✕
draft 168 cover

xAI lança Grok 4.7 mantendo preço do antecessor: o que muda e o que ainda é promessa

22 de setembro de 2026
draft 176 cover

OpenAI libera Agents API, Cognition apresenta SWE-2

22 de setembro de 2026

BioNeMo Inference Runtime: a engine da NVIDIA que turbina predição de proteínas em quase 3x

22 de setembro de 2026

A NVIDIA publicou os detalhes técnicos do BioNeMo Inference Runtime (BioIR), uma biblioteca Python desenhada para acelerar modelos de predição de estrutura biomolecular — ou seja, algoritmos que tentam adivinhar o formato 3D de proteínas a partir da sequência de aminoácidos — mantendo compatibilidade total com PyTorch. O anúncio vem com números robustos: em benchmark pareado com 1.000 alvos diméricos humanos rodando em cluster de 8x H100, o Boltz-2 acelerado pelo BioIR entregou 58,5 mil resíduos dobrados por GPU-hora, contra 20,2 mil de uma implementação open-source apenas compilada com torch.compile (o compilador JIT do PyTorch que tenta otimizar grafos de execução automaticamente). O ganho medido foi de 2,90x.

Onde o ganho acontece

O BioIR ataca o problema em três camadas complementares, e entender essa pilha ajuda a explicar por que o ganho não vem de um único truque de kernel.

A primeira camada é a seleção customizada de kernels — pequenos blocos de código que rodam direto na GPU e executam operações como multiplicação de matrizes, atenção ou convoluções. Em vez de depender do caminho padrão do PyTorch, o runtime escolhe implementações específicas para cada padrão de uso, o que reduz overhead de memória e melhora a ocupação dos SMs (Streaming Multiprocessors, as unidades de execução paralela dentro da GPU).

A segunda camada é a captura via CUDA Graphs. Em workloads de inferência repetitivos (como dobrar milhares de proteínas em sequência), cada chamada de função normalmente dispara uma enxurrada de operações pequenas disparadas pela CPU. CUDA Graphs permitem gravar essa sequência uma vez e replay-a direto na GPU, eliminando o gargalo de lançamento de comandos. O resultado é uma redução brutal de latência por amostra.

A terceira camada é o escalonamento via Ray — framework open-source para orquestração distribuída — posicionando uma cópia completa do modelo por GPU. Em vez de tentar particionar pesos entre múltiplos devices (o chamado tensor parallelism, que troca memória por comunicação inter-GPU custosa), o BioIR replica o modelo inteiro, o que simplifica o batch (lote de inferência) e maximiza throughput quando há memória HBM suficiente — e a H100 oferece 80 GB por GPU.

Por que importa para a indústria biotech

Modelos de folding como Boltz-2 e AlphaFold não são novidades conceituais, mas produtividade em escala muda a equação econômica de projetos inteiros. A diferença entre 20K e 58K resíduos dobrados por GPU-hora significa que uma campanha que antes exigia semanas de cluster pode ser concluída em poucos dias, com o mesmo orçamento de hardware.

O BioIR não é um protótipo de laboratório: a NVIDIA informa que o runtime já alimentou a expansão do AlphaFold Database, gerando cerca de 31 milhões de complexos proteicos candidatos ao longo de 4.777 proteomas — o conjunto completo de proteínas expressas por um organismo. É produção real, em escala genômica.

Caveats e o que ainda não sabemos

O benchmark divulgado é específico para Boltz-2 em configuração 8xH100 com 1.000 alvos diméricos humanos. Não há, na nota pública, dados comparativos com outros modelos de folding nem com hardware mais recente (Hopper de próxima geração ou a linha Blackwell). Também não está claro qual é o custo de memória por réplica completa do modelo — em proteínas muito longas, a abordagem "uma cópia por GPU" pode encontrar limites de HBM antes de saturar compute.

Outro ponto em aberto: o BioIR é PyTorch-nativo, mas a integração com pipelines de produção fora do ecossistema NVIDIA (clusters AMD, TPUs do Google, Inferentia da AWS) não foi detalhada. Para equipes multi-vendor, isso significa continuar dependentes de uma stack CUDA-first.

O que muda para desenvolvedores

Para times que já rodam Boltz-2 ou AlphaFold em produção, a mensagem prática é direta: migrar para BioIR é trocar uma implementação torch.compile por um runtime que cuida de kernel selection, captura de grafos e orquestração distribuída de forma opinativa. Menos engenharia de infraestrutura, mais foco em ciência.

O movimento também reforça uma tendência maior do ecossistema NVIDIA: oferecer runtimes verticais (camadas intermediárias que otimizam modelos para domínios específicos como biologia, química ou clima) por cima do hardware, transformando a H100 de commodity em plataforma stack-completa.

Fontes consultadas

  • MarkTechPost — NVIDIA Details BioNeMo Inference Runtime (BioIR): https://www.marktechpost.com/2026/09/10/nvidia-details-bionemo-inference-runtime-bioir-2-90x-higher-boltz-2-folding-throughput-and-58-5k-residues-per-gpu-hour-on-8xh100/
Topics:
Read next
25 de setembro de 2026

MiniMax Music 3.0: Modelo de música versátil, pronto para produção e de última geração, com recursos abertos.

Hoje, apresentamos o MiniMax Music 3.0, nosso modelo de geração musical de última geração. A partir de um conceito criativo e letras opcionais, o modelo compõe, […]
25 de setembro de 2026

MiniMax M3: Codificação de Fronteira, Contexto 1M, Multimodalidade Nativa — Tudo em um Único Modelo

O MiniMax M3 foi lançado oficialmente hoje. O M3 atinge desempenho de ponta em tarefas especializadas, como codificação e trabalho com agentes. Ele utiliza MSA (MiniMax […]
25 de setembro de 2026

Qwen2.5-Max: Alibaba entra na corrida dos MoE gigantes e expõe o desafio de escalar LLMs

A Alibaba apresenta o Qwen2.5-Max, um modelo Mixture-of-Experts de larga escala, e abre a caixa-preta sobre como treinar LLMs cada vez maiores — um processo que a indústria ainda domina pouco.