Treinamento assíncrono com LoRA amplia uso de GRPO em modelos de linguagem na Hugging Face
A Hugging Face publicou em seu blog um novo conteúdo sobre treinamento de modelos de linguagem por reforço, apresentando a combinação entre o treinador assíncrono GRPO e a técnica LoRA, executados por meio da infraestrutura HF Jobs. O material integra as novidades da biblioteca TRL, voltada ao pós-treinamento de modelos fundamentais e usada pela comunidade para técnicas como ajuste fino supervisionado, GRPO e otimização direta de preferências.
O GRPO, abreviação de Group Relative Policy Optimization, é um algoritmo de aprendizado por reforço aplicado a modelos de linguagem. A abordagem se mostrou mais eficiente em termos de memória do que o tradicional PPO, que é a otimização de política proximal. O GRPO foi utilizado no treinamento do modelo R1 da Deepseek AI e tem se consolidado como alternativa para tarefas verificáveis, como resolução de problemas matemáticos, geração de código e qualquer atividade com critério programático de sucesso.
Na prática, o algoritmo funciona fazendo o modelo gerar respostas, recebendo recompensas com base na correção dessas respostas e aprendendo a partir dos resultados. Esse fluxo se mostrou mais complexo do que técnicas como SFT, que é o ajuste fino supervisionado, ou DPO, a otimização direta de preferências, mas segue uma configuração semelhante segundo a documentação da biblioteca TRL.
A novidade destacada pela publicação é a união do GRPO com LoRA, que significa Low-Rank Adaptation. A técnica LoRA treina pequenas matrizes adaptadoras em vez de atualizar todos os pesos do modelo, o que reduz drasticamente o consumo de memória do otimizador e dos gradientes. Isso torna possível ajustar modelos grandes em hardwares mais modestos. Para modelos de porte médio, entre 3 e 7 bilhões de parâmetros, o uso de LoRA viabiliza o treinamento em hardwares como a10g-large e a100-large, nos quais o ajuste fino completo não caberia na memória disponível.
O terceiro elemento central do anúncio é o HF Jobs, sistema de execução assíncrona de tarefas da própria Hugging Face. Com ele, os treinamentos rodam de forma assíncrona, permitindo que o usuário feche o terminal e retorne mais tarde para conferir o andamento. A integração também inclui suporte ao Trackio, ferramenta que acompanha em tempo real a queda das métricas de perda durante o treinamento.
A biblioteca TRL é construída sobre o ecossistema Transformers e suporta diversas arquiteturas e modalidades, podendo ser escalada em diferentes configurações de hardware. Além das técnicas citadas, oferece outros treinadores como DPOTrainer e KTOTrainer. O conteúdo apresentado no blog reforça que a infraestrutura de aprendizado por reforço assíncrono não deve ser construída como um sistema exclusivo para GRPO, já que o pipeline de geração, pontuação e treinamento é um padrão geral que abrange outras abordagens, como destilação on-policy e auto-destilação.
A escolha pelo LoRA via biblioteca PEFT é descrita como a opção mais comum em diferentes frameworks de código aberto voltados ao treinamento por reforço assíncrono, devido ao formato padronizado de checkpoint, nomeado adapter_model.safetensors, compatível com qualquer loop de treinamento da Hugging Face Transformers. A publicação também destaca que, no entanto, interações com ZeRO-3 exigem cuidados específicos, como desativação do cabeçalho LM fundido em alguns frameworks ou do gradient checkpointing em outros.
A abordagem assíncrona resolve um gargalo comum no treinamento por reforço, que é a criação de paradas no pipeline. Em tarefas agênticas com uso de ferramentas em múltiplos turnos, cada rollout pode levar minutos. Sem um mecanismo para lidar com rollouts em andamento durante a atualização dos pesos, essas janelas síncronas se transformam em travões do pipeline. O suporte a rollouts parciais para cargas agênticas aparece como uma das estratégias apontadas pelo conteúdo para mitigar esse problema.
O anúncio integra um esforço mais amplo da Hugging Face em apoiar treinamento por reforço assíncrono em modelos de código aberto. A publicação original conclui mencionando que múltiplas bibliotecas do ecossistema, como SLIME, MILES, PRIME-RL, AReaL e NeMo-RL, já oferecem suporte tanto ao GRPO quanto à destilação on-policy, justamente porque tratam a fase de recompensa e pontuação como um componente substituível dentro de uma estrutura assíncrona.