✕
draft 115 cover

Jev e a virada “System One” dos modelos de IA: Diogo Almeida, da TypeSafe AI

22 de setembro de 2026
draft 113 cover

Mistral 7B: o modelo open-weight que reescreve a régua da eficiência

22 de setembro de 2026

Mistral AI abre a sua primeira API pública com três endpoints e um modelo de embedding

22 de setembro de 2026

A Mistral AI deu mais um passo para sair do nicho de "modelo open weight" e entrar de vez na briga por infraestrutura de produção. A empresa abriu nesta semana o beta da La Plateforme, sua primeira API hospedada, com três endpoints de chat e um serviço de embedding desenhado para tarefas de busca semântica.

Três endpoints, três faixas de preço

A ideia central da plataforma é simples: oferecer o mesmo modelo em diferentes pontos de uma curva de custo versus qualidade, deixando o desenvolvedor escolher onde quer gastar.

O mistral-tiny é a porta de entrada. Serve o Mistral 7B Instruct v0.2, um update menor do modelo de 7 bilhões de parâmetros (os chamados "pesos matemáticos e conexões neurais que definem a capacidade do modelo") já conhecido da comunidade. Atende apenas em inglês e marca 7.6 no MT-Bench, benchmark (teste padronizado) usado para comparar LLMs (Large Language Models, ou modelos de linguagem de grande porte) em conversas multi-turno. É o endpoint mais barato e suficiente para tarefas simples.

O mistral-small sobe o calibre. Roda o recém-lançado Mixtral 8x7B, modelo que usa a arquitetura Mixture of Experts (MoE) — basicamente, um modelo com vários "especialistas" internos, dos quais apenas alguns são ativados por token (cada pedaço de texto processado), reduzindo custo de inferência (o trabalho de rodar o modelo para gerar respostas) sem perder qualidade. O Mixtral fala inglês, francês, italiano, alemão, espanhol e código, e atinge 8.3 no MT-Bench.

No topo está o mistral-medium, servindo um protótipo que, segundo a própria Mistral, está entre os melhores modelos hospedados disponíveis no mercado. Marca 8.6 no MT-Bench e suporta os mesmos idiomas do small. O ponto importante é que o medium não é open weight — é o cartão de visita fechado da casa, usado para atrair clientes que precisem de máxima qualidade antes de migrar para opções abertas.

Embedding para retrieval

Junto com os endpoints de geração, a Mistral lançou o mistral-embed, serviço de embedding (vetores numéricos que representam o significado de um texto e permitem comparar semanticamente frases, parágrafos e documentos) com 1024 dimensões. O ponto alto é o foco em retrieval — ou seja, em alimentar sistemas de RAG (Retrieval-Augmented Generation), técnica em que o modelo consulta uma base de documentos antes de responder. O score divulgado no MTEB, principal benchmark de embeddings, foi de 55.26.

API no padrão OpenAI, com extras úteis

A Mistral não escondeu a inspiração: a API segue as especificações do formato de chat popularizado pelo principal concorrente. Há bibliotecas cliente em Python e JavaScript, e um detalhe importante: todos os endpoints aceitam system prompt (instrução inicial que define o comportamento e o tom do modelo antes da conversa começar) com configuração de moderação reforçada, recurso útil para aplicações que precisam de camada extra de segurança na saída.

Por que isso importa

A La Plateforme reposiciona a Mistral. Até então, a empresa francesa era vista principalmente como fornecedora de modelos abertos que a comunidade baixava e rodava por conta própria. Com a plataforma, ela entra no mercado de API hospedada — o mesmo onde OpenAI, Anthropic e Google competem por participação de desenvolvedores.

O timing também não é acidental: vem logo após o lançamento do Mixtral 8x7B, mostrando que a Mistral pretende oferecer aos clientes o melhor dos dois mundos — open weights para quem quer autonomia, API gerenciada para quem quer conveniência.

Caveats

  • A plataforma está em beta com capacidade limitada, em rampa para disponibilidade geral.
  • O mistral-medium ainda é um protótipo, sem previsão clara de liberação dos pesos.
  • O mistral-tiny é apenas em inglês, enquanto os outros já são multilíngues.
  • Os preços detalhados por token não foram publicados de forma granular no anúncio.

O crédito à NVIDIA

A Mistral agradeceu publicamente à NVIDIA pelo suporte na integração com TensorRT-LLM (otimizador de inferência da NVIDIA para LLMs) e Triton (servidor de inferência também da NVIDIA), além da colaboração para tornar a arquitetura sparse mixture of experts (MoE esparso, onde só parte dos especialistas é ativada por token) compatível com TRT-LLM — trabalho de engenharia não trivial, já que o stack da NVIDIA não tinha suporte nativo para MoE até então.

A La Plateforme é, na prática, a resposta da Mistral à pergunta que todo desenvolvedor fazia desde 2023: "onde eu rodo esses modelos sem montar a infraestrutura eu mesmo?".


Fonte: Mistral AI — La Plateforme

Topics:
Read next
25 de setembro de 2026

MiniMax Music 3.0: Modelo de música versátil, pronto para produção e de última geração, com recursos abertos.

Hoje, apresentamos o MiniMax Music 3.0, nosso modelo de geração musical de última geração. A partir de um conceito criativo e letras opcionais, o modelo compõe, […]
25 de setembro de 2026

MiniMax M3: Codificação de Fronteira, Contexto 1M, Multimodalidade Nativa — Tudo em um Único Modelo

O MiniMax M3 foi lançado oficialmente hoje. O M3 atinge desempenho de ponta em tarefas especializadas, como codificação e trabalho com agentes. Ele utiliza MSA (MiniMax […]
25 de setembro de 2026

Qwen2.5-Max: Alibaba entra na corrida dos MoE gigantes e expõe o desafio de escalar LLMs

A Alibaba apresenta o Qwen2.5-Max, um modelo Mixture-of-Experts de larga escala, e abre a caixa-preta sobre como treinar LLMs cada vez maiores — um processo que a indústria ainda domina pouco.