AMD e Cerebras anunciaram nesta quarta-feira (23) uma parceria técnica que promete redesenhar a infraestrutura de inferência de IA para aplicações que não toleram demora. A solução conjunta, apresentada na conferência Advancing AI 2026, combina a plataforma rackscale AMD Helios — baseada nos GPUs Instinct — com o Cerebras Wafer-Scale Engine, criando o que as empresas chamam de primeiro fluxo de inferência verdadeiramente disaggregado do mercado.
O que muda na arquitetura
A proposta ataca um gargalo conhecido: workloads de inferência têm perfis muito diferentes entre si. Um chatbot corporativo que precisa engolir prompts enormes com contextos longos consome banda e capacidade de processamento de forma distinta de um agente de codificação que devolve tokens em milissegundos. Hoje, quase toda infraestrutura força o mesmo hardware a servir os dois casos — e paga o preço em latência ou em custo.
A solução da AMD e da Cerebras separa explicitamente as duas fases do fluxo. O AMD Helios assume o papel de motor de alta vazão (throughput), responsável por receber o prompt e processar janelas de contexto massivas. Quando o pedido chega na fase de decodificação — onde o modelo gera token por token em sequência — a bola passa para o Wafer-Scale Engine, o chip em escala de wafer completa da Cerebras, otimizado para entregar cada token com latência mínima.
O resultado combinado promete entregar até 5x mais tokens por segundo por watt (T/s/W) do que abordagens convencionais, segundo as empresas. É um número agressivo, típico de materiais de pré-lançamento, mas que dá a dimensão do salto arquitetural que está sendo proposto.
Por que importa agora
O timing não é acidental. O ecossistema de IA está migrando rápido de cargas batch — onde gerar um relatório de 10 mil palavras podia levar minutos — para cargas agentic, onde agentes autônomos precisam de resposta em tempo real para serem úteis. Codificação assistida, copilots ao vivo, automação robótica e descoberta científica generativa são exemplos citados pela AMD como workloads que morrem sem latência sub-segundo.
A Cerebras, por sua vez, ganha escala. Seu Wafer-Scale Engine já tinha o título de inferência mais rápida do mercado, mas operava em nicho. Ao se integrar ao rackscale Helios, a empresa consegue oferecer seus pontos fortes de latência ultrabaixa para clientes que também precisam de吞吐量 massivo — sem obrigar o cliente a escolher entre as duas coisas.
Andrew Feldman, CEO e cofundador da Cerebras, resumiu a lógica em tom direto: a demanda por inferência ultrarrápida cresce em ritmo sem precedentes, e a parceria com a AMD amplia o alcance dessa capacidade. Lisa Su, presidente e CEO da AMD, enquadrou a colaboração como a extensão natural da liderança do Helios para o segmento mais sensível à latência — o que ela chamou de "plataforma poderosa para agentic AI em tempo real".
Quando chega e onde rodar
A Cerebras pretende implantar sistemas AMD Helios em seus próprios data centers, com a solução conjunta disponível inicialmente através do Cerebras Cloud no segundo semestre de 2026. Não há, ainda, previsão de venda direta para clientes enterprise nem preço公布的 — o modelo de entrada será o cloud da Cerebras, com a AMD ficando mais para o lado da infraestrutura e do stack de GPUs.
O que ainda não sabemos
Três pontos merecem cautela. Primeiro, o número de 5x T/s/W é declarado pelas próprias empresas em material de pré-lançamento; benchmarks independentes ainda não existem. Segundo, o modelo de precificação do Cerebras Cloud não foi divulgado, então não dá para comparar com alternativas como Groq, SambaNova ou mesmo as ofertas baseadas em GPUs Blackwell da NVIDIA. Por fim, a integração entre dois sistemas distintos via inferência disaggregada traz desafios reais de orquestração e de coerência de estado entre os estágios do pipeline — desafios que ficam invisíveis nos slides, mas aparecem rápido em produção.
Ainda assim, o movimento marca um passo interessante: a inferência de IA começa a ser tratada como infraestrutura heterogênea de verdade, em vez de "um cluster de GPUs tocando tudo". Para o mercado brasileiro, a leitura prática é que, se a solução cumprir o prometido, workloads agentic em tempo real rodando em cloud devem ficar mais baratos por token até 2027.


























