A NVIDIA publicou os detalhes técnicos do BioNeMo Inference Runtime (BioIR), uma biblioteca Python desenhada para acelerar modelos de predição de estrutura biomolecular — ou seja, algoritmos que tentam adivinhar o formato 3D de proteínas a partir da sequência de aminoácidos — mantendo compatibilidade total com PyTorch. O anúncio vem com números robustos: em benchmark pareado com 1.000 alvos diméricos humanos rodando em cluster de 8x H100, o Boltz-2 acelerado pelo BioIR entregou 58,5 mil resíduos dobrados por GPU-hora, contra 20,2 mil de uma implementação open-source apenas compilada com torch.compile (o compilador JIT do PyTorch que tenta otimizar grafos de execução automaticamente). O ganho medido foi de 2,90x.
Onde o ganho acontece
O BioIR ataca o problema em três camadas complementares, e entender essa pilha ajuda a explicar por que o ganho não vem de um único truque de kernel.
A primeira camada é a seleção customizada de kernels — pequenos blocos de código que rodam direto na GPU e executam operações como multiplicação de matrizes, atenção ou convoluções. Em vez de depender do caminho padrão do PyTorch, o runtime escolhe implementações específicas para cada padrão de uso, o que reduz overhead de memória e melhora a ocupação dos SMs (Streaming Multiprocessors, as unidades de execução paralela dentro da GPU).
A segunda camada é a captura via CUDA Graphs. Em workloads de inferência repetitivos (como dobrar milhares de proteínas em sequência), cada chamada de função normalmente dispara uma enxurrada de operações pequenas disparadas pela CPU. CUDA Graphs permitem gravar essa sequência uma vez e replay-a direto na GPU, eliminando o gargalo de lançamento de comandos. O resultado é uma redução brutal de latência por amostra.
A terceira camada é o escalonamento via Ray — framework open-source para orquestração distribuída — posicionando uma cópia completa do modelo por GPU. Em vez de tentar particionar pesos entre múltiplos devices (o chamado tensor parallelism, que troca memória por comunicação inter-GPU custosa), o BioIR replica o modelo inteiro, o que simplifica o batch (lote de inferência) e maximiza throughput quando há memória HBM suficiente — e a H100 oferece 80 GB por GPU.
Por que importa para a indústria biotech
Modelos de folding como Boltz-2 e AlphaFold não são novidades conceituais, mas produtividade em escala muda a equação econômica de projetos inteiros. A diferença entre 20K e 58K resíduos dobrados por GPU-hora significa que uma campanha que antes exigia semanas de cluster pode ser concluída em poucos dias, com o mesmo orçamento de hardware.
O BioIR não é um protótipo de laboratório: a NVIDIA informa que o runtime já alimentou a expansão do AlphaFold Database, gerando cerca de 31 milhões de complexos proteicos candidatos ao longo de 4.777 proteomas — o conjunto completo de proteínas expressas por um organismo. É produção real, em escala genômica.
Caveats e o que ainda não sabemos
O benchmark divulgado é específico para Boltz-2 em configuração 8xH100 com 1.000 alvos diméricos humanos. Não há, na nota pública, dados comparativos com outros modelos de folding nem com hardware mais recente (Hopper de próxima geração ou a linha Blackwell). Também não está claro qual é o custo de memória por réplica completa do modelo — em proteínas muito longas, a abordagem "uma cópia por GPU" pode encontrar limites de HBM antes de saturar compute.
Outro ponto em aberto: o BioIR é PyTorch-nativo, mas a integração com pipelines de produção fora do ecossistema NVIDIA (clusters AMD, TPUs do Google, Inferentia da AWS) não foi detalhada. Para equipes multi-vendor, isso significa continuar dependentes de uma stack CUDA-first.
O que muda para desenvolvedores
Para times que já rodam Boltz-2 ou AlphaFold em produção, a mensagem prática é direta: migrar para BioIR é trocar uma implementação torch.compile por um runtime que cuida de kernel selection, captura de grafos e orquestração distribuída de forma opinativa. Menos engenharia de infraestrutura, mais foco em ciência.
O movimento também reforça uma tendência maior do ecossistema NVIDIA: oferecer runtimes verticais (camadas intermediárias que otimizam modelos para domínios específicos como biologia, química ou clima) por cima do hardware, transformando a H100 de commodity em plataforma stack-completa.
Fontes consultadas
- MarkTechPost — NVIDIA Details BioNeMo Inference Runtime (BioIR): https://www.marktechpost.com/2026/09/10/nvidia-details-bionemo-inference-runtime-bioir-2-90x-higher-boltz-2-folding-throughput-and-58-5k-residues-per-gpu-hour-on-8xh100/

























