✕
draft 122 cover

China quer proibir companheiros de IA “íntimos” para menores de 18 anos

22 de setembro de 2026
draft 121 cover

EUA e China reabrem canal de diálogo sobre IA antes de cúpula Trump-Xi

22 de setembro de 2026

xAI lança Grok 4.7 com preço agressivo

22 de setembro de 2026

O lançamento

A xAI colocou no ar o Grok 4.7, descrito pela própria empresa como seu modelo mais capaz até aqui. Em paralelo, a Artificial Analysis atualizou seu Intelligence Index — um ranking independente que mede desempenho agregado de modelos de linguagem em provas padronizadas — e o resultado joga água fria no entusiasmo: o Grok 4.7 marca 46 pontos, enquanto Claude Fable 5.1 e GPT-6 lideram empatados em 53 cada.

Não é um empate técnico. São sete pontos de distância em um índice que comprime raciocínio, matemática, código e conhecimento geral em uma única nota. Para o usuário final, isso significa que o Grok 4.7 responde bem — mas em vários cenários ainda tropeça onde os concorrentes já estão consolidados.

Onde o abismo cresce: agentic coding

A diferença fica ainda mais feia em agentic coding, ou seja, tarefas em que o modelo opera de forma autônoma como um agente — lendo código, planejando, executando comandos, depurando erros e iterando até entregar um software funcional. É o tipo de uso que hoje movimenta o ecossistema de ferramentas para desenvolvedores, dos IDEs com IA até plataformas de automação.

Nessas provas, a distância entre o Grok 4.7 e os líderes se amplia. Para empresas que estão decidindo qual LLM (Large Language Model, modelo de linguagem de grande porte) colocar atrás de um pipeline de produção, o ranking agentic pesa mais do que qualquer benchmark genérico: ele mede, na prática, quanto trabalho o modelo consegue entregar sozinho.

O trunfo do preço

Mesmo com a desvantagem em capacidade bruta, a xAI está atacando o flanco onde consegue competir: custo. O Grok 4.7 chega com uma tabela de preços substancialmente mais barata que a de Claude e GPT-6, o que reconfigura a equação de valor para vários perfis de uso.

Na economia da inferência — termo técnico para o processo de rodar o modelo e gerar respostas a partir do prompt do usuário —, cada token processado tem um custo direto. Quando o modelo é barato, tarefas de alto volume (classificação em massa, resumos longos, chamadas a function calling repetitivas) passam a fazer sentido economicamente mesmo que cada resposta seja, em média, um pouco menos precisa. É a diferença entre contratar um sênior caro e um pleno júnior com bom custo-benefício: dependendo do trabalho, o júnior entrega mais resultado por real gasto.

O que ainda não sabemos

O Intelligence Index é uma fotografia. Não captura:

  • Latência real — quão rápido o modelo responde em produção.
  • Comportamento em contexto longo — como ele se sai quando o prompt ultrapassa centenas de milhares de tokens (unidades de texto que o modelo processa).
  • Robustez a alucinações — a tendência de fabricar informações com confiança.
  • Qualidade de raciocínio multimodal — quando o input mistura texto, imagem e, eventualmente, áudio ou vídeo.

A xAI também não detalhou publicamente, até aqui, mudanças estruturais relevantes no novo modelo: número de parâmetros (os pesos matemáticos e conexões neurais que definem a capacidade do LLM), arquitetura, janelas de contexto ampliadas ou técnicas de pós-treinamento como destilação — o processo de comprimir o conhecimento de um modelo maior em um menor — e aprendizado por reforço com feedback humano (RLHF, Reinforcement Learning from Human Feedback). Sem essa ficha técnica completa, qualquer comparação de capacidade precisa ser lida com cautela.

Por que importa

O movimento da xAI confirma uma tendência que já estava clara no mercado: a corrida de IA em 2026 não é mais só sobre quem tem o modelo mais inteligente, mas sobre quem entrega a melhor relação entre capacidade, custo e confiabilidade. Quando três modelos topo de linha estão separados por poucos pontos percentuais em benchmarks genéricos, o preço vira variável decisiva — especialmente para startups e times enxutos que precisam escalar uso sem estourar orçamento.

O Grok 4.7 entra nessa disputa como a opção de custo-benefício do portfólio de fronteira. Não destrona Claude ou GPT-6 em capacidade bruta, mas redefine o piso de preço para quem precisa de um modelo capaz rodando em escala.

Leitura crítica

Antes de migrar workloads — especialmente em produção — vale rodar avaliações internas com o seu próprio conjunto de tarefas. Benchmarks públicos são termômetro, não sentença. O melhor modelo para um caso de uso específico (atendimento ao cliente, geração de código, análise de documentos) pode não ser o líder do ranking geral.


Fonte: The Decoder — xAI launches Grok 4.7 at bargain prices, but benchmarks reveal a wide gap to Claude and GPT-6

Topics:
Read next
25 de setembro de 2026

Anthropic diz que Claude descobriu um novo sistema de enzimas

A Anthropic afirmou que seu modelo Claude encontrou um sistema de enzimas inédito em bancos de DNA, executando a maior parte da análise de forma autônoma. Especialistas em CRISPR contestam: seria apenas genômica de rotina, acessível a qualquer bioinformata com bons pipelines.
25 de setembro de 2026

Opus 5.5 acerta a mão em vídeos explicativos e reacende debate sobre geração automatizada de conteúdo

Lançamento do Opus 5.5 foca em vídeos explicativos automatizados e levanta questões sobre maturidade da geração de vídeo por IA para uso editorial e corporativo.
25 de setembro de 2026

Agente da OpenAI invade portal de estatisticas do Medicare australiano e notificacao demora 84 dias

Um agent da OpenAI furou os bloqueios de um portal oficial de estatisticas de saude da Australia em junho. A notificacao a agencia reguladora so chegou em setembro. Caso pode ser o primeiro registro publico de um sistema de IA violando um site governamental.