✕
draft 174 cover

DeepSeek v4.1-Flash: a baleia volta à superfície com 763B de parâmetros

22 de setembro de 2026
draft 252 cover

Microsoft escala Helios da AMD no Azure para rodar inferência de modelos de fronteira

24 de setembro de 2026

Intel Extension for PyTorch 2.5.10+xpu turbina LLMs em GPUs Intel

23 de setembro de 2026

A Intel disponibilizou nesta semana a versão 2.5.10+xpu do Intel Extension for PyTorch, a camada de software que conecta o framework de deep learning PyTorch ao hardware de GPU da empresa. A atualização é a primeira construída sobre o PyTorch 2.5.1 e marca um esforço explícito da companhia para tornar suas GPUs — incluindo a linha Data Center Max, a família Arc e os processadores Core Ultra — uma alternativa viável para treinar e servir grandes modelos de linguagem.

O que muda para LLMs

O ponto central da release é um pacote robusto de otimizações para LLMs. AIntel ampliou o gerenciamento de KV Cache (a memória de curto prazo que o modelo usa para não recalcular tokens já processados, essenciais em geração de texto longa), passando a cobrir tanto o método Dynamic Cache quanto o Static Cache definidos pelo Hugging Face. Na prática, isso reduz o tempo de computação e melhora a taxa de resposta em tarefas generativas.

Três recursos novos de inferência chegam ao release:

  • Speculative decoding — o modelo faz palpites educados sobre tokens futuros enquanto gera o token atual, acelerando a inferência sem perda de qualidade perceptível.
  • Sliding window attention — cada token só "olha" para uma janela fixa de contexto anterior, em vez de revisar o documento inteiro. O truque libera memória e aceleradramaticamente o processamento de documentos longos.
  • Multi-round conversations — suporte nativo a diálogos com múltiplas trocas, mantendo coerência entre turnos.

A lista completa de modelos otimizados está disponível na documentação oficial da Intel.

Serving frameworks e quantização

A release também endossa o uso da extensão com os principais frameworks de serving de LLMs do mercado: vLLM e TGI (Text Generation Inference, do Hugging Face). O suporte foi intensivamente verificado em Linux rodando sobre GPUs Intel Data Center Max Series e inclui a quantização INT4 Weight Only via GPTQ (Generalized Post-Training Quantization) — uma técnica que comprime os pesos matemáticos do modelo para inteiros de 4 bits, cortando o consumo de memória com perda mínima de qualidade.

Fine-tuning em beta

O suporte a full fine-tuning e a LoRA (Low-Rank Adaptation, técnica que ajusta apenas um pequeno conjunto de pesos matematicos para adaptar o modelo a uma tarefa) atinge maturidade Beta, agora com precisão mista. É um passo relevante para desenvolvedores que querem customizar modelos em hardware Intel sem recorrer a plataformas externas.

Suporte a hardware e pilha de software

A release confirma compatibilidade com toda a linha de GPUs Intel — Data Center Max, Arc, Core Ultra (incluindo a segunda geração, ou Series 2) e Data Center Flex — e passa a oferecer, em caráter protótipo, suporte à família Intel Arc B-series Graphics no Windows. A integração com o Intel oneDNN 3.6 e com o Intel oneAPI Base Toolkit 2025.0.1 garante acesso às bibliotecas de kernel mais recentes da companhia para operações de deep learning.

Outros dois ajustes estruturais merecem nota:

  • A extensão passa a consumir operadores do repositório Torch XPU Operators sempre que possível, sobrescrevendo apenas um conjunto limitado para ganho de performance. A ideia é reduzir redundância e ampliar o suporte a diferentes tipos de dados.
  • O suporte ao Kineto Profiler foi removido da extensão. Segundo a Intel, o profiler baseado em PTI já está disponível nativamente no PyTorch 2.5, então mantê-lo na extensão era duplicação.

Breaking change e o que observar

A versão 2.5.10+xpu marca o fim do suporte ao Block Format do oneDNN — quem depender desse formato precisa migrar antes de atualizar. A Intel também mantém uma página de Known Issues com limitações ativas que vale consultar antes de colocar a versão em produção.

Por que importa

O mercado de GPUs para IA está mais competitivo do que nunca, e a Intel tem pressionado pelo lado do software — onde a Nvidia ainda domina. Releases como essa mostram que o pipeline Intel para LLMs está amadurecendo rápido: serving frameworks主流, quantização INT4, fine-tuning com LoRA e até suporte a novas Arc no Windows. Para times brasileiros que já têm hardware Intel no data center, a barreira para experimentar modelos generativos começa a ficar mais baixa.


Fontes consultadas

Topics:
Read next
25 de setembro de 2026

Quão atrás da Nvidia está a Huawei? O que o relatório da Epoch AI revela sobre a corrida de chips de IA até 2030

Relatório da Epoch AI avalia o cenário de compute da Huawei até 2030 e mostra que, mesmo com roadmap ambicioso, controles de exportação dos EUA seguem limitando os principais vetores de escala da empresa chinesa frente à Nvidia.
25 de setembro de 2026

Huawei vs Nvidia: a corrida silenciosa pelo silício da IA até 2030

Análise da Epoch AI mostra que a Huawei deve avançar em capacidade de compute até o fim da década, mas export controls travam os principais vetores de escala. O gap com a Nvidia persiste.
24 de setembro de 2026

AMD e Cerebras unem forças para criar stack de inferência com latência ultrabaixa

Parceria anunciada na Advancing AI 2026 combina os GPUs Instinct via AMD Helios com o Wafer-Scale Engine da Cerebras em um único fluxo de inferência. Promessa é de até 5x mais tokens por segundo por watt para aplicações agentic em tempo real.