Equipe Qwen da Alibaba lança Qwen3.8-LiveTranslate, modelo de interpretação em tempo real com latência reduzida para 2,3 segundos
A equipe Qwen, da Alibaba, apresentou o Qwen3.8-LiveTranslate, um modelo de interpretação simultânea em tempo real capaz de ouvir a fala ao vivo, com suporte opcional a quadros de vídeo, e devolver texto e áudio traduzidos enquanto o interlocutor ainda está falando. A principal mudança está em uma nova arquitetura chamada Interleave, que reorganiza o ciclo entre compreensão e geração da tradução para reduzir o atraso médio sem comprometer a qualidade do resultado. Segundo a empresa, o tempo médio de atraso, medido pela métrica LAAL (sigla em inglês para Atraso Médio Adaptativo por Comprimento), caiu de 2,8 segundos para 2,3 segundos, o que representa uma redução aproximada de 18%.
A arquitetura Interleave é o coração da nova versão. Modelos de interpretação simultânea enfrentam um dilema clássico: aguardar mais tempo oferece mais contexto para a tradução, enquanto produzir a resposta mais cedo diminui a espera do ouvinte. O Qwen3.8-LiveTranslate busca equilibrar esse trade-off ao intercalar, em uma única sequência causal, vídeo, áudio, texto de origem e tradução, permitindo que a compreensão e a geração aconteçam de forma conjunta. O modelo é descrito pela QwenCloud como a versão em tempo real do Qwen3.8-LiveTranslate-Flash e é construído sobre a base Qwen-Omni, com dados multimodais em larga escala, alinhamento entre idiomas e modalidades, e melhorias visuais. A versão Flash também oferece suporte para tradução offline de áudio e vídeo.
Entre os novos recursos do modelo, três se destacam. O primeiro é a diarização de falantes em tempo real, que permite distinguir quem está falando em conversas com múltiplos participantes e preservar a voz de cada um por meio de clonagem vocal mais estável. A interface de programação expõe modos de clonagem, com uma opção chamada "always" que recria o clone de voz antes de cada resposta em sessões com vários falantes. O segundo recurso é a exibição bilíngue sincronizada, na qual o texto original e a tradução aparecem lado a lado na tela. Na API, a transcrição do áudio de origem é transmitido como eventos próprios, em paralelo ao fluxo de tradução. O terceiro recurso é a desambiguação por contexto longo, que utiliza o histórico da conversa para resolver nomes próprios e termos técnicos, mantendo a consistência ao longo de toda a tradução, mesmo em reuniões longas.
Em relação aos idiomas, o modelo compreende 60 línguas e é capaz de falar 29 delas, devolvendo áudio e texto. As outras 31 devolvem apenas texto. A geração de voz cobre idiomas como chinês, inglês, árabe, alemão, francês, espanhol, japonês, coreano e hindi, entre outros. As entradas podem ser áudio e, opcionalmente, imagens, enquanto as saídas são texto e áudio. Pistas visuais, como movimentos labiais, gestos e textos na tela, ajudam o modelo em ambientes ruidosos e na interpretação de palavras ambíguas. A documentação recomenda o envio de no máximo duas imagens por segundo. Equipes também podem configurar hotwords, termos do texto de origem mapeados para traduções fixas, com limite sugerido de mil palavras por sessão.
O acesso é feito exclusivamente por API. Os desenvolvedores se conectam por meio da API em tempo real via WebSocket, utilizando o identificador qwen3.8-livetranslate-flash-realtime. O tipo padrão de detecção de turno é speaker_detection, e os clientes transmitem áudio de forma contínua enquanto recebem respostas geradas pelo servidor. O áudio padrão é PCM de 16 quilohertz na entrada e PCM de 24 quilohertz na saída, com a voz padrão chamada Tina. É possível configurar a saída apenas como texto ou como texto e áudio, e a sessão deve ser encerrada com session.finish para evitar perda do último segmento.
Quanto aos preços, a tabela de Singapura, em dólares por milhão de tokens, é de 7,50 para entrada de áudio, 0,55 para entrada de imagem, 20 para saída de texto e 30 para saída de áudio. Os valores em Pequim são menores, equivalentes a 5,653, 0,466, 14,133 e 22,613 dólares, respectivamente. A entrada de áudio consome 7 tokens por segundo, enquanto a saída de áudio consome 12,5 tokens por segundo. Uma hora de fala na entrada e na saída custa cerca de 1,54 dólar em Singapura, sem contabilizar tokens de texto e imagem. A janela de contexto é de 53.248 tokens, sendo 49.152 para entrada e 4.096 para saída, com limites padrão de 10 requisições e 100 mil tokens por minuto. A Model Studio informa que não há suporte para chamada de funções, saídas estruturadas, inferência em lote ou ajuste fino.
O lançamento do Qwen3.8-LiveTranslate reforça o movimento da Alibaba em direção a soluções de tradução multimodais voltadas para cenários reais, como reuniões corporativas, eventos multilíngues e ambientes com múltiplos falantes. Ao reduzir o atraso médio, ampliar o suporte a idiomas e introduzir recursos como diarização de falantes e exibição bilíngue sincronizada, o modelo busca aproximar a interpretação automática da fluidez de um intérprete humano. A disponibilização via API no Alibaba Cloud Model Studio e no QwenCloud indica que o foco imediato da empresa é viabilizar a integração da ferramenta em produtos e serviços de terceiros, com preços e limites técnicos já definidos para desenvolvedores interessados em incorporar tradução simultânea em tempo real em suas aplicações.