webAI lança TwIL-LM, família de modelos compactos focada em raciocínio lógico formal que roda em hardware local

A webAI anunciou o lançamento do TwIL-LM, uma família de modelos de inteligência artificial voltada para raciocínio lógico formal. A nova linha é composta por duas versões com 1,7 bilhão e 3 bilhões de parâmetros, ambas projetadas para tarefas de autoformalização, ou seja, a tradução de textos em inglês para a lógica de primeira ordem, além da verificação de se uma conclusão decorre logicamente de suas premissas. O anúncio destaca que os modelos superam o gpt-oss-120b em quatro das cinco categorias de raciocínio formal avaliadas.

Revolução em Inteligência Artificial: webAI Lança Modelo Compacto TwIL-LM para Raciocínio Lógico Formal Local - Imagem complementar

A versão de 3 bilhões de parâmetros, chamada TwIL-LM3, é um ajuste fino (processo de treinamento adicional para especializar um modelo pré-existente) do modelo SmolLM3-3B, resultado da fusão de diferentes checkpoints, isto é, versões intermediárias salvas durante o treinamento. Já a versão de 1,7 bilhão utiliza um adaptador LoRA aplicado sobre o SmolLM2-1.7B-Instruct. A técnica LoRA, ou Low-Rank Adaptation, permite treinar pequenas porções de um modelo maior de forma eficiente, sem necessidade de retreinar todos os parâmetros.

PUBLICIDADE

Um dos grandes diferenciais da família TwIL-LM é a possibilidade de execução totalmente local. O modelo de 1,7 bilhão tem uma versão quantizada (técnica que reduz o tamanho do modelo comprimindo seus números internos) de apenas 1,06 gigabyte, enquanto o TwIL-LM3 possui uma versão no formato Q4_K_M GGUF, um padrão de compactação usado para executar modelos em CPUs e GPUs modestas, com 1,78 gibibyte. O arquivo GGUF é o formato utilizado pelo llama.cpp, mecanismo que permite rodar modelos de linguagem em computadores comuns sem depender de servidores na nuvem. Segundo a webAI, o modelo de 3 bilhões consegue operar em CPU ou em placas com apenas 4 gigabytes de memória de vídeo.

O licenciamento, porém, impõe restrições importantes. Ambos os modelos são distribuídos sob a webAI Non-Commercial License versão 1.0, o que significa que só podem ser utilizados para fins não comerciais. Para implantações que gerem receita, é necessário firmar um acordo separado com a empresa. A companhia posiciona a execução local como especialmente relevante para ambientes em que os dados não podem deixar o dispositivo, citando setores como o jurídico, o financeiro, o farmacêutico, o de saúde e o de pesquisa em métodos formais.

A construção do TwIL-LM3 passou por quatro etapas principais. A primeira foi um ajuste fino supervisionado com LoRA, treinado em um corpus sintético de lógica formal. Em seguida, foi feita a fusão de checkpoints por meio da média dos parâmetros intermediários no espaço de pesos. A terceira etapa aplicou a técnica WiSE-FT, uma interpolação de pesos entre o modelo ajustado e o modelo base pré-treinado, definida em λ = 0,25, preservando apenas um quarto do delta de ajuste. Por fim, foi executada a fase MGPO, uma variante que pondera por entropia (medida de incerteza nas respostas do modelo) e utiliza o método GRPO, um algoritmo de aprendizado por reforço baseado em comparação entre saídas, com um verificador programático. O checkpoint publicado corresponde ao passo 2071 do treinamento.

O valor de λ igual a 0,25 mostrou-se determinante. Um braço experimental que dispensou a interpolação WiSE-FT obteve pontuação mais alta dentro do domínio, com macro gate de 0,515, mas perdeu cerca de doze pontos em capacidade de generalização fora do domínio. Esse braço não foi publicado pela webAI.

Nos benchmarks divulgados pela empresa, o TwIL-LM3 atingiu 96,4 em indução de regras, 87,6 em parsing semântico, 64,6 em formalização para Lean, 52,0 em respostas em formato exato e 68,7 em classificação de implicação lógica. Na trilha de avaliação interna focada em lógica formal, o modelo obteve 0,4488 na média de seis pistas e 0,4218 no macro gate, métrica principal do pipeline de treinamento. Ele lidera todas as variantes menores, incluindo o LFM2.5-8B-A1B, ficando à frente com um terço dos parâmetros, mas não supera os maiores.

A grande vantagem do TwIL-LM3 está na eficiência. O modelo gera as respostas mais curtas entre todos os avaliados, com 482 tokens na trilha B, e atinge 32,9 respostas por segundo, contra 4,2 do gpt-oss-120b. Em transferência fora do domínio, o TwIL-LM3 melhorou em 26 por cento o desempenho relativo dentro do domínio e ganhou 0,022 na média de benchmarks externos, sendo o único braço do projeto a avançar nas duas trilhas simultaneamente. O LogicBench subiu para 0,7167, o GSM8K recuou ligeiramente para 0,8733 e o IFEval caiu para 0,6433.

A versão de 1,7 bilhão apresenta um equilíbrio diferente. Seu macro primário foi de 0,361, contra 0,185 do modelo base sem adaptação. Fora da distribuição, os resultados foram mistos: o LogicBench BQA subiu para 0,590, mas o GSM8K caiu para 0,380 e o ARC-C com chain-of-thought, técnica que estimula o modelo a mostrar o raciocínio passo a passo antes da resposta final, recuou para 0,463. No fim das contas, a família TwIL-LM reforça a tendência de modelos compactos e executáveis localmente assumirem tarefas antes restritas a grandes modelos na nuvem, ainda que dentro de limitações de uso comercial claramente definidas.