LFM2.5-DSpark chega para acelerar modelos da Liquid AI com decodificação especulativa
A Liquid AI disponibilizou recentemente os checkpoints da linha LFM2.5-DSpark no Hugging Face, uma tecnologia baseada em decodificação especulativa que promete reduzir significativamente o tempo de inferência dos modelos da família LFM2.5. A técnica permite acelerar a geração de texto sem alterar o resultado final, mantendo a saída idêntica à do modelo alvo original.
A decodificação especulativa é um método que utiliza um modelo menor, chamado de drafter, para propor tokens que são em seguida verificados pelo modelo principal. Segundo a publicação da empresa, esse processo é exato, ou seja, o modelo alvo confirma cada token proposto, de modo que a saída final permanece idêntica à que seria gerada apenas pelo modelo principal. Métricas como draft_n e draft_n_accepted são reportadas nos tempos de resposta para indicar quantos tokens foram propostos e quantos foram efetivamente aceitos.
De acordo com a empresa, o uso do DSpark pode resultar em acelerações de até 3,2 vezes na velocidade de inferência, dependendo da configuração de hardware e do modelo utilizado. Os checkpoints DSpark estão disponíveis em dois formatos: Safetensors, compatível com o ecossistema padrão do Hugging Face, e GGUF, voltado para execução em CPUs e dispositivos com recursos limitados.
A família LFM2.5 é descrita pela Liquid AI como uma nova geração de modelos híbridos projetados para implantação em dispositivos locais, com pré-treinamento estendido e uso de aprendizado por reforço. Os modelos DSpark foram lançados em diferentes tamanhos para acompanhar as principais variantes da linha. Entre os modelos anunciados estão o LFM2.5-2.6B-DSpark, o LFM2.5-1.2B-Instruct-DSpark e o LFM2.5-8B-A1B-DSpark, cada um pareado com o respectivo modelo alvo da família LFM2.5.
No caso específico do LFM2.5-1.2B-Instruct, a Liquid AI destaca que é possível acoplar o drafter LFM2.5-1.2B-Instruct-DSpark, com cerca de 296 milhões de parâmetros, para obter uma decodificação aproximadamente 2,1 vezes mais rápida no SGLang e cerca de 2,5 vezes mais rápida em dispositivos com chip da Apple utilizando o backend Metal, sempre mantendo as mesmas saídas do modelo original.
Para utilizar os modelos DSpark, a publicação indica que é necessário um build do SGLang com suporte à tecnologia para alvos LFM2. O lançamento do servidor é feito informando o caminho do modelo alvo, do drafter e o algoritmo especulativo DSPARK, além do backend de atenção flashinfer para o modelo de rascunho. Parâmetros adicionais como disable-radix-cache, mem-fraction-static e a porta de escuta também fazem parte do comando padrão de inicialização.
A disponibilização dos modelos DSpark no Hugging Face integra a estratégia mais ampla da Liquid AI de oferecer modelos voltados para execução local, com foco em dispositivos de borda e aplicações que demandam baixa latência. A empresa reforça que os modelos da família LFM2.5 são híbridos e otimizados para diferentes plataformas, incluindo llama.cpp, MLX e outros frameworks compatíveis com execução em CPU e GPU.
Com a chegada do LFM2.5-DSpark, a Liquid AI amplia o conjunto de ferramentas voltadas para acelerar a inferência de modelos de linguagem em ambientes com recursos computacionais variados. A combinação entre modelos compactos, suporte a múltiplos formatos de arquivo e integração com frameworks amplamente utilizados aponta para um cenário em que a execução local de modelos de inteligência artificial se torna cada vez mais viável em diferentes tipos de hardware, desde servidores equipados com GPUs de alto desempenho até dispositivos pessoais com chips otimizados para inferência.