PrismML lança Ternary Bonsai 2 27B: modelo comprimido mantém 98,2% do desempenho com apenas 5,9 GB

A empresa PrismML anunciou o lançamento do Ternary Bonsai 2 27B, uma versão compacta do modelo Qwen3.8 27B que utiliza pesos ternários para reduzir drasticamente o tamanho do arquivo sem perder praticamente nenhuma capacidade. O modelo ocupa apenas 5,93 GB em disco, contra 53,80 GB da versão original em precisão FP16, representando uma redução de aproximadamente nove vezes no espaço ocupado.

Ternary Bonsai 2 27B: a IA de 27 bilhões de parâmetros que encolheu 9 vezes e roda no seu laptop - Imagem complementar

O grande diferencial do novo lançamento é a retenção de 98,2% do desempenho médio do modelo original em um conjunto de 20 benchmarks, uma evolução significativa em relação à primeira versão do Bonsai 27B, lançada cerca de dois meses antes e que mantinha cerca de 95% do desempenho. O Ternary Bonsai 2 27B aceita entradas de texto e imagens, suporta uma janela de contexto de 262 mil tokens e foi demonstrado pela empresa conduzindo agentes de codificação e uso de computador em uma placa de vídeo RTX 5090.

PUBLICIDADE

A arquitetura do Qwen3.8 27B foi mantida integralmente, totalizando 27,36 bilhões de parâmetros distribuídos entre um backbone linguístico de 24,35 bilhões, 2,54 bilhões em embeddings e cabeçote do modelo de linguagem, além de uma torre de visão de 0,47 bilhão. O backbone utiliza atenção híbrida, combinando cerca de 75% de camadas de atenção linear com 25% de camadas de atenção completa. Os pesos ternários cobrem embeddings, projeções de atenção, projeções de MLP e o cabeçote do modelo de linguagem, enquanto apenas 26,2 milhões de parâmetros, equivalente a 0,0976% do total, permanecem em precisão mais alta por estarem ligados a caminhos de estado recorrente e normalização.

O formato ternário funciona atribuindo a cada peso apenas três valores possíveis: -1, 0 ou +1. Cada grupo de 128 pesos compartilha uma escala em FP16, o que resulta em cerca de 1,585 bits por valor ternário e 1,71 bits por peso considerando as escalas. Existem dois empacotamentos disponíveis no formato GGUF: o PTQ1_0, que armazena os trits de forma compacta em 1,76 bits por peso totalizando 5,93 GB, e o PQ2_0, que guarda cada trit em um espaço de 2 bits totalizando 7,25 GB e facilita o desempacotamento em diferentes hardwares. Antes da atribuição dos valores ternários, a PrismML aplica uma rotação Hadamard em blocos de 1.024 elementos, técnica inspirada no método SpinQuant, com a transformação correspondente sendo aplicada às ativações em tempo de execução.

Nos benchmarks avaliados pela própria empresa utilizando EvalScope e vLLM em placas H100 no modo de raciocínio, o modelo atingiu 83,9 pontos na média geral de 20 testes, frente aos 85,4 do Qwen3.8 27B original. Em matemática, o modelo comprimido obteve 96,57 contra 97,06, em codificação 81,58 contra 82,17, em raciocínio e conhecimento 83,95 contra 86,66, em chamada de ferramentas agentic 77,57 contra 79,74, e em visão 78,59 contra 81,64. Em instrução, chegou a superar levemente o modelo base, com 82,66 contra 81,25.

A comparação com técnicas tradicionais de quantização revela um resultado ainda mais expressivo. Uma versão IQ2_XXS do Qwen3.8 27B, de 7,3 GB, atinge média de 75,2 pontos. No benchmark AIME26, o Bonsai 2 obteve 95,83 contra 78,6 do IQ2_XXS, e no LiveCodeBench v6 a diferença foi de 90,07 contra 70,05.

Apesar do bom desempenho médio, algumas tarefas sofrem perdas mais acentuadas. Benchmarks de agentes de longo prazo, como o Terminal-Bench 2.1 e o SWE-bench Verified, retêm apenas cerca de 75% da pontuação da versão original, ficando fora da média geral. No modo de raciocínio com esforço médio, o modelo atinge 79,3 pontos contra 82,6 da versão FP16, e o modo de baixo esforço não é suportado.

Em termos de velocidade, testes realizados pela equipe de pesquisa da PrismML em 16 de setembro de 2026 indicam que uma RTX 5090 processa 142,5 tokens por segundo com consumo de 0,582 miliwatts-hora por token. A RTX 4090 atinge 96,7 tokens por segundo com o empacotamento PTQ1_0, enquanto uma L4 de 72 watts chega a 32,1 tokens por segundo. Em Macs com chip M5 Max, a velocidade registrada foi de 46,8 tokens por segundo, e no M5 Pro de 27,7 tokens por segundo. A empresa também afirma que o modelo oferece 40% mais eficiência energética que um modelo 8B em precisão completa.

O modelo está disponível sob a licença Apache 2.0 e pode ser executado em um laptop com 16 GB de memória RAM ou em uma única GPU de 24 GB. Para rodar, é necessário utilizar o fork do llama.cpp mantido pela PrismML, já que a versão oficial não reconhece os tipos PTQ1_0 e PQ2_0. Usuários de Mac podem optar pelo pacote MLX com carregador dedicado. Há ainda uma demonstração em WebGPU que permite executar o modelo diretamente no navegador.