Aikido Security lança Altar-1, modelo aberto de segurança compactado para rodar em infraestrutura local
A Aikido Security apresentou o Altar-1, seu primeiro modelo de segurança com pesos abertos, desenvolvido para operar dentro de infraestruturas controladas pelo próprio cliente. O modelo é uma versão compactada do GLM-5.3, da Z.AI, e alimenta o Aikido Machine, um appliance autônomo de testes de penetração voltado para ambientes locais e redes isoladas da internet, conhecidas como air-gapped.
O lançamento do Altar-1 responde a uma limitação central dos modelos de fronteira fechados, aqueles modelos de IA mais avançados e de grande porte atualmente disponíveis. Esses sistemas rodam em infraestrutura de terceiros, o que significa que código-fonte, documentos de arquitetura e achados de vulnerabilidades precisam deixar a rede do cliente para serem processados. Para instituições sujeitas a exigências de residência de dados, como bancos, ou para operadores de tecnologia operacional sem rota de internet, essa arquitetura simplesmente não é viável.
A solução encontrada pela Aikido foi partir do GLM-5.3, um modelo de arquitetura chamada mixture-of-experts, ou mistura de especialistas, que conta com 753 bilhões de parâmetros totais. Nesse tipo de modelo, cada token, ou seja, cada unidade básica de texto processada, é roteado para oito dos 256 especialistas disponíveis em cada camada, o que resulta em cerca de 40 bilhões de parâmetros ativos. Embora esse desenho permita alta capacidade com custo computacional moderado, ele exige o armazenamento de todos os especialistas, mesmo quando apenas uma fração deles é utilizada em determinada tarefa.
Para viabilizar o uso em ambientes com recursos limitados, a Aikido aplicou duas etapas de compressão. Na primeira, utilizou a técnica AWQ, que armazena os pesos dos especialistas roteados em 4 bits, uma unidade de medida de informação computacional, com ativações em 16 bits, em um formato conhecido como W4A16. Camadas de atenção, especialistas compartilhados, camadas densas e o cabeçalho do modelo permaneceram em BF16, formato de 16 bits usado para preservar precisão. Esse primeiro passo reduziu o tamanho do modelo de 1.506,7 GB para 488,2 GB.
Na segunda etapa, a empresa recorreu ao método REAP, desenvolvido pela Cerebras, que significa Router-weighted Expert Activation Pruning, ou poda de especialistas ponderada pelo roteador. Diferente de métodos que simplesmente eliminam os especialistas menos acionados, o REAP avalia cada especialista com base no peso do roteador e na magnitude da saída, preservando aqueles com contribuições reais para domínios específicos. A calibração utilizou rastros do próprio conjunto de testes de penetração da Aikido, além de dados de codificação, chamada de ferramentas, raciocínio e textos multilíngues da Wikipédia. A empresa afirma que nenhum dado de cliente foi utilizado nesse processo.
Após a poda, o Altar-1 mantém 168 dos 256 especialistas roteados por camada, removendo 88 especialistas, o que representa 34,4% do total. Como não há retreinamento envolvido, o roteador continua selecionando oito especialistas por token, agora entre 168, mantendo aproximadamente 40 bilhões de parâmetros ativos. O resultado final é um modelo de 328 GB, 78,2% menor que a versão original em BF16 e 32,8% menor que a versão quantizada em AWQ.
Nos testes internos da Aikido, conduzidos em um benchmark próprio com 32 vulnerabilidades conhecidas distribuídas em 30 repositórios, o modelo GLM-5.3 em BF16 alcançou recall médio de 65,6%, identificando 25 das 32 falhas. A versão quantizada em AWQ obteve 61,5% de recall e identificou 23 vulnerabilidades. Já o Altar-1 atingiu 60,4% de recall, também encontrando 23 das 32 falhas. Em comparação com a versão AWQ, a poda custou cerca de um ponto percentual de recall sem perda de cobertura. Frente ao modelo original, o Altar-1 preserva 92% das vulnerabilidades cobertas, com queda de 5,2 pontos no recall médio. A Aikido também relatou que o Altar-1 encontrou uma vulnerabilidade crítica válida durante um teste de penetração em ambiente de produção de um cliente, embora se trate de um resultado isolado informado pela própria empresa.
Para a implantação, o modelo exige GPUs da família Hopper, como as H100 ou H200 da NVIDIA. A Aikido indica que 328 GB distribuídos em quatro GPUs H200 deixam espaço para um cache de contexto de 128 mil tokens em tamanhos de lote de produção. O modelo pode ser servido por meio do vLLM, mecanismo de execução de grandes modelos de linguagem, e os pesos estão disponíveis publicamente no Hugging Face. Já uma configuração com quatro GPUs H100 de 80 GB oferece apenas 320 GB de memória, volume insuficiente para os 328 GB de pesos do modelo.
Em relação à licença, o Altar-1 herda os termos do GLM-5.3, que permitem uso comercial, modificação e redistribuição. Operadores de modelo como serviço com receita superior a 10 bilhões de dólares em um período de 12 meses precisam passar por uma revisão de segurança conduzida pela Z.AI. O Altar-1 é classificado como open-weight, com pesos abertos, e não como código aberto segundo as definições da OSI.
Além do Aikido Machine, o modelo também dá suporte a outras soluções da empresa, como Aikido Attack, AI Code Analysis e Deep Review. Nos próximos passos, a Aikido pretende testar formatos de bits ainda mais baixos, como o EXL3, para preservar mais especialistas, além de ajustar modelos para fluxos de trabalho específicos de segurança.