✕
draft 131 cover

Robby Stein, do Google, confirma presença no TechCrunch Disrupt 2026

22 de setembro de 2026
draft 158 cover

OpenAI lança GPT-6 e agente Astra: novo patamar de capacidade com preço de token 2,5x maior

22 de setembro de 2026

Claude Mythos 5.1: novo modelo da Anthropic corta preço de cache em 75% e aumenta output em 70%

22 de setembro de 2026

A Anthropic acaba de colocar mais um capítulo na corrida dos modelos de fronteira, e o movimento tem duas leituras simultâneas: poder de fogo bruto e economia de inferência — ou seja, o custo real de rodar o modelo em produção.

O que mudou no Mythos 5.1

O Claude Mythos 5.1 chega com títulos de SOTA (state of the art) em benchmarks de raciocínio, segundo o anúncio da empresa e a cobertura da Latent.Space. SOTA, no jargão da indústria, significa simplesmente "o melhor resultado já registrado naquela avaliação" — o topo da tabela, até alguém bater.

Junto com a performance, veio uma mexida agressiva na tabela de preços. O cache hit — quando o sistema reaproveita um trecho de texto já processado em uma requisição anterior, em vez de recalcular tudo do zero — caiu 75%. É o tipo de corte que muda a conta de qualquer produto que dependa de contexto longo ou de prompts repetidos.

A outra mudança parece contraditória à primeira vista, mas não é: o output (a quantidade de texto que o modelo gera por requisição) subiu 70% pelo mesmo preço. Para o desenvolvedor, isso significa a mesma fatura com muito mais resposta por chamada — útil em agentes, pipelines de RAG (Retrieval-Augmented Generation, ou "geração aumentada por recuperação", quando o modelo consulta uma base de conhecimento antes de responder) e fluxos agentic (sistemas que executam tarefas em múltiplos passos de forma autônoma).

Por que importa agora

Dois efeitos práticos merecem destaque.

Primeiro, a redução no KV Cache — a memória interna que guarda chaves e valores da atenção do transformer para evitar recomputações — derruba o custo de aplicações com contexto repetido. Casos clássicos são chatbots com histórico longo, sistemas que re-injetam o mesmo prompt de sistema a cada turno e ferramentas de análise de documentos estáticos. Para esses cenários, o custo por token efetivamente despenca.

Segundo, o aumento de output incentiva workflows onde o modelo escreve bastante em uma única chamada: geração de código longa, relatórios analíticos, ou raciocínio encadeado (o famoso chain-of-thought, ou "cadeia de pensamento", em que o modelo explicita seus passos intermediários antes da resposta final). Em benchmarks de raciocínio, mais tokens de saída geralmente correlacionam com melhor qualidade — e a nova margem dá folga para explorar isso sem estourar orçamento.

A leitura competitiva

O movimento chega em um momento de pressão sobre o ecossistema. Modelos abertos e rivais diretos vinham oferecendo preços agressivos, e a Anthropic responde combinando duas alavancas: liderança em benchmark e custo total de operação menor. É a mesma lógica que guiou o corte de preço do Claude 3 Haiku e do Sonnet no início do ano — manter a fronteira de capacidade enquanto reduz a barreira de adoção.

Há também um sinal estratégico no recorte do corte. Atacar o cache hit em 75% não é acidental: APIs concorrentes precificam cache de forma parecida, e a Anthropic está claramente disposta a abrir mão de margem nesse item para capturar workloads que dependem de reutilização de contexto — exatamente o terreno onde frameworks agentic gastam a maior parte do orçamento.

Caveats

Alguns pontos exigem cautela. Os números de SOTA referem-se a benchmarks específicos divulgados pela própria empresa e replicados por terceiros; o salto real em tarefas de produção varia conforme o domínio. A métrica de "+70% de output" precisa ser lida com atenção: indica teto de geração por requisição, não necessariamente qualidade absoluta do conteúdo.

Também vale notar que mudanças de preço em uma API costumam ser acompanhadas de ajuste em rate limits, throughput e latência em regiões específicas — variáveis que só aparecem com carga real em produção.

O que observar a seguir

Três indicadores vão dizer se o Mythos 5.1 sustenta a aposta:

  • Adoção em workloads agentic, onde a economia de cache tem impacto direto no custo por tarefa concluída.
  • Reação da OpenAI e do ecossistema open-weight, que costumam responder com cortes de preço equivalentes em ciclos de semanas.
  • Estabilidade do modelo sob prompts adversariais e em janelas de contexto longas, área historicamente sensível nas linhas Claude.

A tendência é clara: a próxima frente de competição não é só "quem pontua mais no benchmark", mas "quem entrega mais tokens úteis por dólar". E a Anthropic acaba de mover a régua.


Fonte: Latent.Space — Claude Fable/Mythos 5.1

Topics:
Read next
25 de setembro de 2026

Anthropic diz que Claude descobriu um novo sistema de enzimas

A Anthropic afirmou que seu modelo Claude encontrou um sistema de enzimas inédito em bancos de DNA, executando a maior parte da análise de forma autônoma. Especialistas em CRISPR contestam: seria apenas genômica de rotina, acessível a qualquer bioinformata com bons pipelines.
25 de setembro de 2026

Opus 5.5 acerta a mão em vídeos explicativos e reacende debate sobre geração automatizada de conteúdo

Lançamento do Opus 5.5 foca em vídeos explicativos automatizados e levanta questões sobre maturidade da geração de vídeo por IA para uso editorial e corporativo.
25 de setembro de 2026

Rankings de AI Agent Harnesses em setembro de 2026: O que mudou com Fable 5.1, Gemini 3.8 Flash ?

Seis plataformas de agent harness foram reclassificadas em setembro de 2026 após updates importantes como Fable 5.1, Gemini 3.8 Flash e Muse Spark 1.3. Entenda o que entrou, o que saiu e por que as camadas de runtime e employee continuam de fora.