A queda que não para
Pagar para rodar um modelo de IA que atinja um determinado nível de performance ficou cerca de 13 vezes mais barato a cada ano, segundo medições recentes da Epoch AI. É um ritmo de deflação que não tem precedente em nenhuma outra tecnologia rastreada pela história econômica moderna — mais agressivo do que semicondutores, mais agressivo do que telecomunicações, mais agressivo do que a energia solar na fase inicial de sua curva de aprendizado.
Para entender o que esse número significa na prática, vale separar dois efeitos que costumam andar juntos e serem confundidos.
Hardware versus algoritmo
Quando o preço de um nível de performance cai, dois fatores contribuem: chips mais rápidos e algoritmos mais eficientes. O MIT estimou, em trabalho recente, que o componente puramente algorítmico — isto é, o ganho que vem de software, arquitetura e métodos de treinamento, sem incluir a evolução do silício — responde por cerca de 3x ao ano de redução de custo.
Os outros ~4x ao ano vêm do hardware. Quando se soma tudo, chega-se à magnitude observada pela Epoch AI: a cada ano que passa, o mesmo marco de capacidade custa uma fração cada vez menor para ser atingido.
O detalhe que derruba a ilusão
Esse movimento explica por que proliferam modelos abertos cada vez mais capazes a preços quase simbólicos, e por que a barreira de entrada para experimentar IA generativa despencou. Mas existe uma armadilha na leitura otimista: nem todo modelo de ponta ficou mais barato.
Modelos de raciocínio (reasoning models), aqueles que “pensam em voz alta” antes de entregar a resposta — produzindo cadeias internas de raciocínio, verificações intermediárias e múltiplas tentativas —, podem custar mais por tarefa do que modelos equivalentes de geração direta. A razão é simples: consomem muito mais compute (capacidade de processamento bruto gasta a cada consulta) por chamada. Mais tokens gerados, mais operações internas, mais latência, mais conta de energia.
Na prática, escolher um modelo deixou de ser uma decisão de preço e virou uma decisão de qualidade por dólar, ponderada por três variáveis que andam juntas: qualidade da resposta, velocidade de execução e taxa de erro. O menor custo unitário serve de métrica macroeconômica; no chão de fábrica, o que vale é o custo da resposta útil.
O que ainda não sabemos
A Epoch AI mede desempenho em benchmarks — testes padronizados que servem de régua comparativa entre modelos. É a forma mais rigorosa de comparar, mas também a mais estreita. Benchmarks não capturam nuances de uso real, distribuição de tarefas, custo de retry quando a resposta vem ruim nem o trabalho humano de revisar e ajustar o output.
Há também uma incerteza temporal importante: a curva de 13x por ano não é garantia eterna. Puxa parte de sua força de um cenário competitivo com múltiploslaboratórios abertos e fechados lançando variantes agressivas em sequência. Se a corrida esfriar, se a margem de otimização algorítmica se esgotar antes da próxima geração de hardware, ou se os custos de inferência em escala (inference, a fase em que o modelo já treinado responde a pedidos reais) pararem de cair, o número muda.
Outro ponto cego: a maioria das medições captura modelos de linguagem generalistas. Modelos multimodais, agentes autônomos e sistemas de raciocínio encadeado têm curvas próprias, frequentemente piores, porque cada token gerado, cada ferramenta chamada e cada passo de planejamento custa.
Por que importa agora
Para empresas e desenvolvedores brasileiros que estão decidindo onde alocar orçamento em IA, a mensagem prática é direta: o custo bruto de uma chamada de modelo continua caindo, então prototipar ficou barato — o risco financeiro de testar uma ideia nova em produção caiu junto. Ao mesmo tempo, workloads pesados de raciocínio continuam cobrando seu preço, e a tentação de migrar tudo para a variante mais barata do mercado pode custar caro em qualidade e em revisão humana.
A deflação da IA é real, rápida e histórica. Mas deflação de capacidade não é o mesmo que deflação de produto final. Enquanto os pesos matemáticos e conexões neurais que definem a capacidade do modelo continuarem sendo otimizados em ritmo comparável ao da Lei de Moore original, a próxima camada da pilha — a camada de raciocínio — vai ditar onde o dinheiro de fato vai parar.

























