✕

Pesquisadores chineses avançam em chips abaixo de 3 nm usando litografia antiga

25 de setembro de 2026

Agente da OpenAI invade portal de estatisticas do Medicare australiano e notificacao demora 84 dias

25 de setembro de 2026

GGUF, GPTQ, AWQ e EXL2: como escolher o formato certo para rodar um LLM em casa ou em produção

25 de setembro de 2026

Rodar um modelo de linguagem grande fora da nuvem deixou de ser curiosidade de garagem. Hoje, escolher entre GGUF, GPTQ, AWQ e EXL2 é uma decisão de engenharia que define se o LLM vai caber na memória de um Macbook, de uma GPU de consumidor ou de um servidor de produção. O guia publicado pelo MarkTechPost separa o joio do trigo: existem formatos de arquivo e existem métodos de quantização (quantization) — e confundir os dois é o erro mais comum de quem está começando.

O problema que todos resolvem

Um LLM moderno carrega bilhões de pesos matemáticos e conexões neurais que definem a capacidade do modelo. Cada peso originalmente armazenado em 16 bits pode ser comprimido para 4, 3 ou até 2 bits por parâmetro sem destruir a utilidade prática do modelo. Essa compressão, chamada quantização, é o que permite carregar um modelo de 70B parâmetros em hardware doméstico. O formato de arquivo, por sua vez, é o "pacote" que entrega esses pesos quantizados junto com os metadados necessários para o software de inferência (inference) carregá-los corretamente.

GGUF, GPTQ, AWQ e EXL2 atacam o mesmo problema com filosofias diferentes.

GGUF: o canivete suíço do ecossistema llama.cpp

O GGUF (GPT-Generated Unified Format) é o sucessor do GGML e virou o padrão de fato para quem roda modelos via llama.cpp e derivados — Ollama, LM Studio, KoboldCpp. O grande trunfo é a portabilidade: o mesmo arquivo funciona em CPU Apple Silicon (chips M1, M2, M3 e M4), GPUs NVIDIA e até CPUs x86 comuns. Internamente, ele pode carregar diferentes esquemas de quantização (Q4_K_M, Q5_K_S, Q8_0, entre outros), o que dá flexibilidade para trocar precisão sem trocar de formato.

Na prática, GGUF é a escolha óbvia para Macs, para quem quer simplicidade e para experimentação rápida.

GPTQ: o clássico das GPUs NVIDIA

O GPTQ nasceu em 2022 como um dos primeiros métodos práticos de quantização pós-treinamento para GPUs. Ele usa um processo de calibração (calibration) com dados reais para minimizar o erro de quantização, entregando modelos que rodam principalmente em 4 bits. O formato depende de kernels CUDA específicos, então o suporte fora de hardware NVIDIA é limitado.

É a opção madura para quem serve modelos em GPUs de datacenter ou em workstations com RTX 3090, 4090 e similares. A maioria dos modelos open weight (pesos abertos) ainda oferece variante GPTQ por compatibilidade.

AWQ: proteção aos pesos importantes

O AWQ (Activation-aware Weight Quantization) parte de uma observação elegante: nem todo peso contribui igualmente para a saída do modelo. Em vez de quantizar tudo de forma uniforme, o método identifica os canais mais críticos a partir das ativações (activation) — os valores que circulam pela rede durante o processamento — e preserva a precisão neles, comprimindo o resto de forma agressiva.

O resultado costuma ser melhor qualidade por bit do que GPTQ em 4 bits, especialmente em modelos grandes. AWQ também roda em GPUs NVIDIA e ganhou tração em servidores de inferência de baixo custo.

EXL2 e a chegada do EXL3

O EXL2 é o formato associado à biblioteca exllamav2, focada em extrair o máximo de performance (tokens por segundo) de GPUs NVIDIA. Ele introduz o conceito de "quantização por mix de bits" (bpw — bits per weight variável por camada), permitindo que parte do modelo fique em 6 bits e outra em 3, conforme o que o hardware aceita melhor.

Já o EXL3 é a evolução natural, trazendo suporte mais limpo a arquiteturas recentes e melhor integração com TabbyAPI e ExUI. Para quem mede latência em milissegundos e roda modelos em produção, EXL2/EXL3 virou referência de velocidade.

Como escolher na prática

  • Macbook ou PC sem GPU dedicada: GGUF, sem pensar duas vezes. Ollama resolve em um comando.
  • GPU NVIDIA de consumidor (RTX 3060 a 4090): AWQ ou EXL2, dependendo se a prioridade é qualidade por bit (AWQ) ou throughput bruto (EXL2).
  • Servidor de produção em NVIDIA: EXL3 e AWQ disputam; a escolha depende do modelo base e do mecanismo de serving.
  • Experimento acadêmico ou compatibilidade ampla: GPTQ continua sendo o seguro contra defeito.

O ponto central é entender que formato e método de quantização são camadas independentes. Um mesmo método (por exemplo, AWQ) pode ser distribuído em diferentes containers, e a qualidade final depende tanto do algoritmo quanto de como ele foi aplicado ao modelo.

O que ainda pesa contra

Quantização agressiva cobra um preço: tarefas que exigem raciocínio fino, contagem e aritmética precisa costumam degradar mais. Modelos menores e bem destilados (distillation) geralmente aceitam quantização melhor do que modelos gigantes no limite. E, na prática, a diferença entre Q4_K_M e Q5_K_M no GGUF costuma ser pequena para uso casual, mas perceptível em benchmarks técnicos.

A recomendação geral continua válida: testar o modelo no seu caso de uso real, com seus prompts reais, antes de comprometer uma stack de produção inteira a um único formato.


Fontes consultadas: MarkTechPost — GGUF vs GPTQ vs AWQ vs EXL2: LLM Model Formats Explained (2026)

Topics:
Read next
25 de setembro de 2026

MiniMax Music 3.0: Modelo de música versátil, pronto para produção e de última geração, com recursos abertos.

Hoje, apresentamos o MiniMax Music 3.0, nosso modelo de geração musical de última geração. A partir de um conceito criativo e letras opcionais, o modelo compõe, […]
25 de setembro de 2026

MiniMax H3: Um modelo aberto que rompe as fronteiras entre tarefas e modalidades.

Hoje, estamos lançando o MiniMax H3, um modelo de geração multimodal de uso geral. O H3 compreende o contexto unificado de texto, imagens, vídeo e áudio, […]
25 de setembro de 2026

MiniMax M3: Codificação de Fronteira, Contexto 1M, Multimodalidade Nativa — Tudo em um Único Modelo

O MiniMax M3 foi lançado oficialmente hoje. O M3 atinge desempenho de ponta em tarefas especializadas, como codificação e trabalho com agentes. Ele utiliza MSA (MiniMax […]