✕

Qwen2.5-Omni: o modelo multimodal que enxerga, escuta e fala em tempo real

25 de setembro de 2026

MiniMax M3: Codificação de Fronteira, Contexto 1M, Multimodalidade Nativa — Tudo em um Único Modelo

25 de setembro de 2026

Decodificação Especulativa DFlash na AMD Instinct MI355X: Inferência do Qwen3.5 até 5 vezes mais rápida

25 de setembro de 2026

A latência de inferência em LLMs é, hoje, um jogo de streaming de pesos. Cada token (unidade de texto gerada pelo modelo) exige um forward pass completo, e o gargalo não está na conta bruta do chip — está em quão rápido a GPU consegue alimentar o modelo com seus próprios pesos matemáticos e conexões neurais que definem sua capacidade. Para atacar esse gargalo, a indústria vem apostando em uma técnica chamada speculative decoding: um modelo menor, o drafter, propõe vários tokens de uma vez, e o modelo grande, o target, valida tudo em um único passe paralelo. Se a maioria for aceita, o resultado é mais texto por segundo sem perda de qualidade.

A AMD publicou um post técnico em seu blog de ROCm mostrando que o DFlash, um drafter baseado em block-diffusion, agora roda no Instinct MI355X através do stack vLLM sobre ROCm. A comparação foi direta com o MTP (Multi-Token Prediction), o drafter nativo que o Qwen3.5 já traz embutido em sua arquitetura.

O que muda em relação ao MTP nativo

O MTP do Qwen3.5 foi pensado como peça acoplada ao próprio modelo principal: ele compartilha parte dos parâmetros e foi treinado em conjunto com o target, o que dá coerência, mas amarra o desenvolvedor àquela família específica de modelos. O DFlash aparece como uma alternativa de drafter independente, aplicável a diferentes targets.

A abordagem block-diffusion tem uma vantagem operacional interessante: em vez de gerar um token por vez dentro de cada bloco, ela difunde (gera em paralelo) os tokens dentro de uma janela fixa. O target, então, verifica o bloco inteiro de uma só vez. Na prática, isso reduz o número de forward passes do modelo grande necessários para entregar a mesma quantidade de texto.

Latência, não throughput

É importante frisar um ponto que o próprio post da AMD deixa explícito: o ganho de até 5x medido no benchmark aparece no regime de single-request latency — ou seja, na velocidade com que um único prompt recebe sua resposta token a token. Em cenários de alto throughput agregado, com muitos requests em paralelo enchendo a GPU, o cenário muda, porque o chip já passa a ser limitado por compute em vez de por banda de memória.

A conta é simples: se a GPU está ociosa esperando os pesos chegarem, qualquer truque que reduza o número de passes (como speculative decoding) ajuda. Se a GPU está saturada fazendo contas, o gargalo é outro, e a especulação deixa de ser bala de prata.

Quantização mxfp4 empilha com a especulação

O ponto mais pragmático do post é a demonstração final: depois de validar o DFlash contra o MTP, a equipe quantiza o target para mxfp4 (um formato de ponto flutuante de 4 bits da especificação MX da OCP) e mostra que especulação e quantização se somam. Reduzir a precisão numérica dos pesos corta memória e banda, enquanto o speculative decoding corta passes. São dois mecanismos independentes atacando o mesmo gargalo por ângulos diferentes, e eles combinam.

Isso é relevante para quem roda Qwen3.5 em produção no hardware AMD e procura extrair mais tokens por segundo sem trocar de modelo.

O que ainda não sabemos

O post é uma demonstração de engenharia, não um paper revisado por pares. Alguns pontos ficam em aberto para quem pretende replicar ou extrapolar:

  • Ganhos foram medidos em MI355X com vLLM/ROCm; o comportamento em outras GPUs MI (MI300X, MI325X) pode variar.
  • A aceitação média do drafter (taxa de tokens propostos que o target confirma) é o termômetro real do método — quanto menor, mais passes extras o target precisa fazer e menos o truque compensa.
  • A comparação com MTP depende de configurações específicas; em workloads criativos longos, com distribuição de tokens mais imprevisível, a vantagem de um drafter externo tende a cair.

Por que importa

Speculative decoding já era promessa em hardware NVIDIA; vê-lo rodando de forma nativa no stack AMD com integração via vLLM é um sinal de maturidade do ecossistema ROCm para inferência de LLMs modernos. Para o desenvolvedor brasileiro avaliando custo por token em data centers, o caminho agora inclui opções além do stack CUDA — e benchmarks como esse ajudam a decidir quando vale o desvio.

Fontes consultadas

Topics:
Read next
25 de setembro de 2026

Qwen2.5-Omni: o modelo multimodal que enxerga, escuta e fala em tempo real

A Alibaba liberar Qwen2.5-Omni, um modelo end-to-end que processa texto, imagem, áudio e vídeo e devolve respostas em texto e fala natural com streaming. Veja o que muda na corrida multimodal.
25 de setembro de 2026

Qwen2.5-VL-32B: a Alibaba aperta o parafuso em modelos multimodais leves

Alibaba open-sourcing o Qwen2.5-VL-32B-Instruct sob Apache 2.0, com escala de 32B de parametros e foco em visao-linguagem. O que muda frente a geracao anterior e por que o tamanho importa.
25 de setembro de 2026

QwQ-Max-Preview: Alibaba abre preview do novo modelo de raciocínio da família Qwen

Alibaba libera prévia do QwQ-Max-Preview, modelo baseado no Qwen2.5-Max focado em raciocínio e agentic workflows. Entenda o que muda e por que o preview importa antes da versão final.