Rodar um modelo de linguagem grande fora da nuvem deixou de ser curiosidade de garagem. Hoje, escolher entre GGUF, GPTQ, AWQ e EXL2 é uma decisão de engenharia que define se o LLM vai caber na memória de um Macbook, de uma GPU de consumidor ou de um servidor de produção. O guia publicado pelo MarkTechPost separa o joio do trigo: existem formatos de arquivo e existem métodos de quantização (quantization) — e confundir os dois é o erro mais comum de quem está começando.
O problema que todos resolvem
Um LLM moderno carrega bilhões de pesos matemáticos e conexões neurais que definem a capacidade do modelo. Cada peso originalmente armazenado em 16 bits pode ser comprimido para 4, 3 ou até 2 bits por parâmetro sem destruir a utilidade prática do modelo. Essa compressão, chamada quantização, é o que permite carregar um modelo de 70B parâmetros em hardware doméstico. O formato de arquivo, por sua vez, é o "pacote" que entrega esses pesos quantizados junto com os metadados necessários para o software de inferência (inference) carregá-los corretamente.
GGUF, GPTQ, AWQ e EXL2 atacam o mesmo problema com filosofias diferentes.
GGUF: o canivete suíço do ecossistema llama.cpp
O GGUF (GPT-Generated Unified Format) é o sucessor do GGML e virou o padrão de fato para quem roda modelos via llama.cpp e derivados — Ollama, LM Studio, KoboldCpp. O grande trunfo é a portabilidade: o mesmo arquivo funciona em CPU Apple Silicon (chips M1, M2, M3 e M4), GPUs NVIDIA e até CPUs x86 comuns. Internamente, ele pode carregar diferentes esquemas de quantização (Q4_K_M, Q5_K_S, Q8_0, entre outros), o que dá flexibilidade para trocar precisão sem trocar de formato.
Na prática, GGUF é a escolha óbvia para Macs, para quem quer simplicidade e para experimentação rápida.
GPTQ: o clássico das GPUs NVIDIA
O GPTQ nasceu em 2022 como um dos primeiros métodos práticos de quantização pós-treinamento para GPUs. Ele usa um processo de calibração (calibration) com dados reais para minimizar o erro de quantização, entregando modelos que rodam principalmente em 4 bits. O formato depende de kernels CUDA específicos, então o suporte fora de hardware NVIDIA é limitado.
É a opção madura para quem serve modelos em GPUs de datacenter ou em workstations com RTX 3090, 4090 e similares. A maioria dos modelos open weight (pesos abertos) ainda oferece variante GPTQ por compatibilidade.
AWQ: proteção aos pesos importantes
O AWQ (Activation-aware Weight Quantization) parte de uma observação elegante: nem todo peso contribui igualmente para a saída do modelo. Em vez de quantizar tudo de forma uniforme, o método identifica os canais mais críticos a partir das ativações (activation) — os valores que circulam pela rede durante o processamento — e preserva a precisão neles, comprimindo o resto de forma agressiva.
O resultado costuma ser melhor qualidade por bit do que GPTQ em 4 bits, especialmente em modelos grandes. AWQ também roda em GPUs NVIDIA e ganhou tração em servidores de inferência de baixo custo.
EXL2 e a chegada do EXL3
O EXL2 é o formato associado à biblioteca exllamav2, focada em extrair o máximo de performance (tokens por segundo) de GPUs NVIDIA. Ele introduz o conceito de "quantização por mix de bits" (bpw — bits per weight variável por camada), permitindo que parte do modelo fique em 6 bits e outra em 3, conforme o que o hardware aceita melhor.
Já o EXL3 é a evolução natural, trazendo suporte mais limpo a arquiteturas recentes e melhor integração com TabbyAPI e ExUI. Para quem mede latência em milissegundos e roda modelos em produção, EXL2/EXL3 virou referência de velocidade.
Como escolher na prática
- Macbook ou PC sem GPU dedicada: GGUF, sem pensar duas vezes. Ollama resolve em um comando.
- GPU NVIDIA de consumidor (RTX 3060 a 4090): AWQ ou EXL2, dependendo se a prioridade é qualidade por bit (AWQ) ou throughput bruto (EXL2).
- Servidor de produção em NVIDIA: EXL3 e AWQ disputam; a escolha depende do modelo base e do mecanismo de serving.
- Experimento acadêmico ou compatibilidade ampla: GPTQ continua sendo o seguro contra defeito.
O ponto central é entender que formato e método de quantização são camadas independentes. Um mesmo método (por exemplo, AWQ) pode ser distribuído em diferentes containers, e a qualidade final depende tanto do algoritmo quanto de como ele foi aplicado ao modelo.
O que ainda pesa contra
Quantização agressiva cobra um preço: tarefas que exigem raciocínio fino, contagem e aritmética precisa costumam degradar mais. Modelos menores e bem destilados (distillation) geralmente aceitam quantização melhor do que modelos gigantes no limite. E, na prática, a diferença entre Q4_K_M e Q5_K_M no GGUF costuma ser pequena para uso casual, mas perceptível em benchmarks técnicos.
A recomendação geral continua válida: testar o modelo no seu caso de uso real, com seus prompts reais, antes de comprometer uma stack de produção inteira a um único formato.
Fontes consultadas: MarkTechPost — GGUF vs GPTQ vs AWQ vs EXL2: LLM Model Formats Explained (2026)

























