✕

Qwen3.8-LiveTranslate reduz latencia de traducao simultanea para 2.3 segundos em 60 linguas

25 de setembro de 2026

Qwen2.5-Max: Alibaba entra na corrida dos MoE gigantes e expõe o desafio de escalar LLMs

25 de setembro de 2026

Qwen3.8-Omni-Flash chega como aposta multimodal da Alibaba para agentes de IA com preço agressivo

25 de setembro de 2026

A Alibaba acaba de apresentar o Qwen3.8-Omni-Flash, seu primeiro modelo multimodal (que entende e gera mais de um tipo de dado, como texto, áudio e vídeo a partir de uma única arquitetura) pensado desde o rascunho para alimentar agentes de IA — sistemas que não apenas respondem perguntas, mas decidem sozinhos quais ferramentas externas chamar para executar uma tarefa. O lançamento marca a entrada formal da Qwen no competitivo segmento de modelos omni, onde já figuram Google, OpenAI e o ecossistema open source.

O que muda em relação aos antecessores

A grande virada está na fusão nativa entre áudio e vídeo. Em vez de tratar cada modalidade como um pipeline separado — onde um modelo transcreve o áudio, outro analisa o vídeo e um terceiro combina os resultados — o Omni-Flash processa os dois fluxos em conjunto, preservando a relação temporal entre fala, ruído ambiente e imagem. Isso permite que o agente realize edições de vlog, traduza trechos de um vídeo ou produza resumos de filmes com menos perda de contexto entre o que se vê e o que se ouve.

Outro diferencial é o uso autônomo de ferramentas (o chamado tool calling). O modelo pode decidir, sem intervenção humana a cada passo, que precisa rodar um classificador externo, consultar uma base de conhecimento ou acionar um módulo de edição antes de devolver a resposta final.

Performance equivalente por uma fração do custo

Nos benchmarks áudio-vídeo avaliados pela própria Alibaba e replicados por veículos especializados, o Qwen3.8-Omni-Flash ficou muito próximo do Gemini 3.8 Flash, modelo multimodal do Google voltado para tarefas rápidas e de alta volumetria. O detalhe que muda o cálculo de qualquer equipe de produto está no preço de API: a Alibaba está cobrando uma fração do que o Gemini Flash cobra pelo mesmo tipo de chamada multimodal.

Para empresas que rodam pipelines com milhares de minutos de vídeo processados por dia, a diferença entre os dois preços pode decidir se um produto de análise de mídia sai do papel ou trava no comitê financeiro. Modelos com capacidade multimodal nativa tendem a inflar a conta porque cada segundo de áudio e cada frame de vídeo consome tokens — as unidades de texto que o modelo fatura — multiplicando o custo total da inferência (a execução do modelo para gerar uma resposta).

Por que isso importa agora

O movimento da Alibaba sinaliza uma nova rodada da guerra de preços em modelos multimodais. Quando um player do porte da Qwen oferece paridade de benchmark com custo muito menor, a pressão recai sobre Google, OpenAI e Anthropic, que precisam justificar seu pricing premium com ganhos reais de latência (o tempo de resposta entre a pergunta e o resultado) ou qualidade.

Para desenvolvedores brasileiros e times de produto em mercados sensíveis a custo, a novidade abre uma janela para experimentar fluxos antes economicamente inviáveis: legendagem automática de vídeos longos, sumarização de podcasts com identificação de vozes, monitoramento de mídia audiovisual em larga escala.

O que ainda não sabemos

Alguns pontos seguem em aberto. A Alibaba não divulgou, até o momento, detalhes finos sobre o tamanho do modelo em parâmetros — os pesos matemáticos e conexões neurais que definem a capacidade da arquitetura — nem dados independentes de latência em produção. Benchmarks publicados pela própria dona do modelo tendem a pintar um quadro favorável, e só testes externos com workloads reais vão confirmar se a paridade com o Gemini Flash se sustenta fora de ambiente controlado.

Também fica a dúvida sobre a estratégia de distribuição: se o Omni-Flash ficará disponível apenas via API na plataforma Alibaba Cloud ou se haverá versões open weight (modelos com pesos abertos, que qualquer empresa pode baixar e rodar em sua própria infraestrutura) para a comunidade rodar localmente, como aconteceu com iterações anteriores da família Qwen.

A corrida multimodal acabou de ganhar mais um competidor — e, desta vez, o barulho vem do caixa.


Fonte consultada: the-decoder — Qwen3.8-Omni-Flash undercuts Google’s Gemini Flash pricing while matching its multimodal benchmarks

Topics:
Read next
25 de setembro de 2026

Decodificação Especulativa DFlash na AMD Instinct MI355X: Inferência do Qwen3.5 até 5 vezes mais rápida

Post técnico da AMD demonstra DFlash, um drafter block-diffusion rodando via vLLM no ROCm, batendo de frente com o MTP nativo do Qwen3.5 e ainda empilhando quantização mxfp4.
25 de setembro de 2026

Qwen2.5-Omni: o modelo multimodal que enxerga, escuta e fala em tempo real

A Alibaba liberar Qwen2.5-Omni, um modelo end-to-end que processa texto, imagem, áudio e vídeo e devolve respostas em texto e fala natural com streaming. Veja o que muda na corrida multimodal.
25 de setembro de 2026

Qwen2.5-VL-32B: a Alibaba aperta o parafuso em modelos multimodais leves

Alibaba open-sourcing o Qwen2.5-VL-32B-Instruct sob Apache 2.0, com escala de 32B de parametros e foco em visao-linguagem. O que muda frente a geracao anterior e por que o tamanho importa.