A latência de inferência em LLMs é, hoje, um jogo de streaming de pesos. Cada token (unidade de texto gerada pelo modelo) exige um forward pass completo, e o gargalo não está na conta bruta do chip — está em quão rápido a GPU consegue alimentar o modelo com seus próprios pesos matemáticos e conexões neurais que definem sua capacidade. Para atacar esse gargalo, a indústria vem apostando em uma técnica chamada speculative decoding: um modelo menor, o drafter, propõe vários tokens de uma vez, e o modelo grande, o target, valida tudo em um único passe paralelo. Se a maioria for aceita, o resultado é mais texto por segundo sem perda de qualidade.
A AMD publicou um post técnico em seu blog de ROCm mostrando que o DFlash, um drafter baseado em block-diffusion, agora roda no Instinct MI355X através do stack vLLM sobre ROCm. A comparação foi direta com o MTP (Multi-Token Prediction), o drafter nativo que o Qwen3.5 já traz embutido em sua arquitetura.
O que muda em relação ao MTP nativo
O MTP do Qwen3.5 foi pensado como peça acoplada ao próprio modelo principal: ele compartilha parte dos parâmetros e foi treinado em conjunto com o target, o que dá coerência, mas amarra o desenvolvedor àquela família específica de modelos. O DFlash aparece como uma alternativa de drafter independente, aplicável a diferentes targets.
A abordagem block-diffusion tem uma vantagem operacional interessante: em vez de gerar um token por vez dentro de cada bloco, ela difunde (gera em paralelo) os tokens dentro de uma janela fixa. O target, então, verifica o bloco inteiro de uma só vez. Na prática, isso reduz o número de forward passes do modelo grande necessários para entregar a mesma quantidade de texto.
Latência, não throughput
É importante frisar um ponto que o próprio post da AMD deixa explícito: o ganho de até 5x medido no benchmark aparece no regime de single-request latency — ou seja, na velocidade com que um único prompt recebe sua resposta token a token. Em cenários de alto throughput agregado, com muitos requests em paralelo enchendo a GPU, o cenário muda, porque o chip já passa a ser limitado por compute em vez de por banda de memória.
A conta é simples: se a GPU está ociosa esperando os pesos chegarem, qualquer truque que reduza o número de passes (como speculative decoding) ajuda. Se a GPU está saturada fazendo contas, o gargalo é outro, e a especulação deixa de ser bala de prata.
Quantização mxfp4 empilha com a especulação
O ponto mais pragmático do post é a demonstração final: depois de validar o DFlash contra o MTP, a equipe quantiza o target para mxfp4 (um formato de ponto flutuante de 4 bits da especificação MX da OCP) e mostra que especulação e quantização se somam. Reduzir a precisão numérica dos pesos corta memória e banda, enquanto o speculative decoding corta passes. São dois mecanismos independentes atacando o mesmo gargalo por ângulos diferentes, e eles combinam.
Isso é relevante para quem roda Qwen3.5 em produção no hardware AMD e procura extrair mais tokens por segundo sem trocar de modelo.
O que ainda não sabemos
O post é uma demonstração de engenharia, não um paper revisado por pares. Alguns pontos ficam em aberto para quem pretende replicar ou extrapolar:
- Ganhos foram medidos em MI355X com vLLM/ROCm; o comportamento em outras GPUs MI (MI300X, MI325X) pode variar.
- A aceitação média do drafter (taxa de tokens propostos que o target confirma) é o termômetro real do método — quanto menor, mais passes extras o target precisa fazer e menos o truque compensa.
- A comparação com MTP depende de configurações específicas; em workloads criativos longos, com distribuição de tokens mais imprevisível, a vantagem de um drafter externo tende a cair.
Por que importa
Speculative decoding já era promessa em hardware NVIDIA; vê-lo rodando de forma nativa no stack AMD com integração via vLLM é um sinal de maturidade do ecossistema ROCm para inferência de LLMs modernos. Para o desenvolvedor brasileiro avaliando custo por token em data centers, o caminho agora inclui opções além do stack CUDA — e benchmarks como esse ajudam a decidir quando vale o desvio.
Fontes consultadas
- AMD ROCm Blogs — DFlash Speculative Decoding on AMD Instinct MI355X


























