Matemática de memória
Uma única conta decide o que você consegue rodar localmente: o que cabe na RAM. No fim desta lição você vai prever, de cabeça, se um modelo entra nos seus 128 GB — e vai entender por que o DeepSeek-V4-Flash (284 B) só cabe em 2 bits, e por que mesmo assim continua inteligente.
Esta lição destila esse artigo + medições reais no M5 Max. Os números todos têm fonte (rodapé). Por que importa pra missão: é o filtro que diz, antes do download, se o cérebro local do Alembic roda neste Mac.
- Prever de cabeça se um modelo cabe nos 128 GB com a fórmula
params × bits ÷ 8. - Ler a escada de quantização (FP16 → Q2) e o que cada degrau custa em qualidade.
- Aplicar a folga de 10–20% (pesos + KV + SO) sem estourar a RAM.
- Explicar por que o DeepSeek-V4-Flash sobrevive a 2 bits (quant assimétrica).
01 · A fórmula que decide tudo
Antes de qualquer download, antes de escolher engine, antes de pensar em velocidade, existe uma pergunta que ou passa ou reprova o modelo: os pesos cabem na memória? Se não cabem, nada mais importa — o modelo nem carrega. E a conta para responder isso é deliberadamente simples:
VRAM (em GB) ≈ Parâmetros (bilhões) × (bits efetivos ÷ 8). That's it.— Ahmad Osman, "GPU Memory Math for LLMs (2026)"
Anatomia: o que cada termo significa
A fórmula tem três peças, e cada uma é um conceito que vale entender de verdade — não decorar:
Parâmetros são os números que o modelo aprendeu no treino — os "pesos". Um modelo "de 284 B" tem 284 bilhões deles. Bits por peso é quanta precisão você guarda de cada número: 16 bits é o original de treino; 2 bits é uma versão fortemente comprimida. O ÷ 8 só converte bits em bytes (8 bits = 1 byte), porque memória se mede em bytes. Multiplique os três e você tem os gigabytes que os pesos ocupam — antes de KV cache e sistema (que entram na seção 05 e na Lição 06).
284 × 16 ÷ 8 = 568 GB — mais de 4× os 128 GB do seu Mac, e mais que o Mac Studio topo de linha (512 GB). Se você chutou "uns 100 GB", subestimou o custo do FP16: cada peso em 16 bits custa 2 bytes, e 284 bilhões deles somam meio terabyte. É exatamente por isso que rodar local exige quantizar — assunto da próxima seção.Cabe ou não cabe? O mesmo modelo, duas precisões
O veredito de capacidade é binário: ou os pesos entram nos 128 GB, ou o modelo nem carrega. Veja o mesmo DeepSeek-V4-Flash decidido pela fórmula em duas precisões — FP16 estoura, Q2 entra:
Agora calcule você mesmo
Arraste os dois sliders. A barra cresce em escala real e troca de cor — verde = cabe, vermelho = não cabe nos 128 GB do M5 Max:
Escala: 0–170 GB · a linha vermelha é o teto do seu Mac. Repare: 284 B em 16-bit = 568 GB (some da tela); só em ~2 bits (≈71 GB) entra.
02 · O que é, de fato, "quantização"
A fórmula mostrou que bits por peso é a alavanca da memória. Quantizar é puxar essa alavanca: guardar cada peso em menos bits. O modelo treina em 16 bits (FP16/BF16) por peso; quantizar reescreve esses mesmos pesos numa grade mais grossa de valores — menos casas, menos memória, alguma perda de fidelidade.
De 16 para 2 quadrados por peso = ⅛ da memória. Mas com menos bits sobram menos valores possíveis: a grade fica grossa e detalhes finos (justo os que importam para raciocínio e código) começam a sumir.
A escada completa — e o que cada degrau custa
Não existe só "16 ou 2". Há uma escada de formatos. Esta é a referência prática para o seu Mac, em GB por bilhão de parâmetros:
| Formato | Bits | GB / 1B | Quando usar |
|---|---|---|---|
| FP16 / BF16 | 16 | 2.0 | Treino e referência; raramente para rodar local (caro demais) |
| FP8 | 8 | 1.0 | Quase sem perda; ótimo se a memória permite |
| Q6_K | ~6 | 0.82 | Praticamente indistinguível do original |
| Q4_K | ~4 | 0.56 | Sweet spot consumer — melhor equilíbrio qualidade/tamanho |
| Q2_K | ~2 | 0.33 | Só para caber um modelo grande; degrada math/código/tools |
Mexa o slider abaixo: o degrau correspondente acende. Veja como a barra encolhe a cada formato — é a memória que você economiza, e (seção 05) a qualidade que arrisca:
A escada como escada: cada degrau troca memória por fidelidade
Pense na quantização como uma escada que você desce: cada degrau abaixo corta a memória, mas também corta um pouco da fidelidade. Você desce só até onde precisa caber — nem um degrau a mais, porque cada degrau abaixo do necessário é qualidade jogada fora de graça:
03 · O que cabe nos seus 128 GB
Com a fórmula e a escada na mão, dá para responder a pergunta de capacidade para qualquer modelo. Duas leituras complementares: primeiro um caso concreto (o DeepSeek-V4-Flash de 284 B em cada precisão), depois uma grade geral para você explorar.
O caso do 284 B, em escala real
As barras abaixo estão na mesma escala do teto de 128 GB. Repare: só a Q2 cruza para baixo da linha.
É por isso que o DS4 quantiza em 2 bits: não é escolha estética, é a única precisão em que um modelo desse porte entra em 128 GB. Em Q4 já seriam 159 GB — você precisaria de um Mac Studio de 256 GB.
A grade geral — explore
Mexa o slider de tamanho: a linha do modelo acende e cada célula mostra ✓ (cabe) / ✗ (não cabe) em 128 GB, com os GB de pesos calculados pela fórmula.
A 284 B (DeepSeek-V4-Flash) só a coluna Q2 fica verde — exatamente por isso o DS4 quantiza em 2 bits. Já um 70 B cabe folgado até em Q4.
04 · Faça a conta na mão (passo a passo → agora você)
Você já viu a fórmula girar nos sliders. Agora faça-a na mão, devagar, com o caso de referência — depois um exercício é seu. Recuperar o procedimento (não só ver o número pronto) é o que fixa de verdade.
params × bits ÷ 8 = 284 × 2 ÷ 8 = 71 GB de pesos (conta de guardanapo).70 × 4 ÷ 8 = 35 GB de pesos → cabe com folga enorme (sobram ~93 GB para KV + SO + um segundo modelo, se quiser). Dica: o procedimento é sempre o mesmo — só trocam os três números. Repare como o desafio do curso é o oposto: caber um gigante (284 B), não um 70 B.05 · A folga: nunca encha a RAM até 100%
Os pesos são só uma parte do que ocupa a memória durante a inferência. Encher a RAM até a borda com os pesos e achar que "cabe" é um erro clássico — na hora de rodar, mais coisas disputam o mesmo espaço:
Leave 10 to 20 percent headroom. Running at 99 percent VRAM is begging for out-of-memory and fragmentation failures.— Ahmad Osman, "LLMs 101 (2026)"
• KV cache — a memória de trabalho da conversa; cresce com o tamanho do contexto (~0,5 MiB por token em FP16; detalhes na Lição 06).
• Ativações — buffers temporários de cada passo.
• SO + apps — o macOS e seus programas precisam de vários GB.
• OOM — estourar a memória mata o processo na hora.
• Fragmentação — alocar perto do limite falha mesmo "tendo" espaço.
• Contexto longo — o KV cresce durante a geração; o que cabia no início pode estourar no fim.
Agora sinta a regra: arraste o uso total e veja quando você cruza o teto seguro de 80% (~102 GB):
06 · Decisão: "esse modelo roda no meu Mac?" (fluxograma)
Junte a fórmula, a escada e a folga numa única decisão. Diante de qualquer modelo novo, siga este fluxograma de cabeça: ele leva da pergunta de capacidade até o veredito "baixa" ou "pula". Siga as setas — cada losango é uma pergunta que escolhe o caminho.
07 · Menor+preciso vence maior+esmagado
A tentação é sempre "baixar o maior modelo que couber". Mas memória não é a única variável — fidelidade por peso também conta. Um modelo menor em alta precisão frequentemente ganha de um maior comprimido demais:
A smaller model at higher precision can beat a larger model crushed into too few bits.— Ahmad Osman, "LLMs 101 (2026)"
Clique para comparar dois modelos que ocupam memória parecida:
Então como o DeepSeek (284B) sobrevive a 2 bits?
Aqui está a peça que fecha a lição. Se 2-bit ingênuo destrói a qualidade, como o DS4 entrega um modelo de 284 B em 81 GB que ainda chama ferramentas de forma confiável? A resposta é quantização assimétrica: ele não esmaga tudo igual. A maior parte do volume (os "experts" do MoE, que raramente são acionados juntos) vai para 2 bits; as poucas camadas críticas (atenção, projeções compartilhadas, roteamento) ficam em 8 bits.
It's not a joke — it calls tools reliably even at 2-bit.— antirez, DS4 MODEL_CARD (sobre a quant assimétrica do DeepSeek-V4-Flash)
É por isso que o GGUF real dá 81 GB e não os 71 da conta limpa: aquele "a mais" são as camadas mantidas em Q8 de propósito. A fórmula te diz o piso; a engenharia da quantização decide se o modelo continua útil — assunto inteiro da Lição 04.
.bin/pickle de fontes não-confiáveis (pickle executa código ao carregar); prefira GGUF ou safetensors, que são só dados. — Ahmad Osman.08 · Q2 vs Q4 vs FP16: o trade-off lado a lado
Toda a lição gira em torno de um trade-off: menos bits = menos RAM, mas menos qualidade. Veja-o explícito, na mesma tabela, para os mesmos 284 B do DS4 — memória, veredito de capacidade e o que cada precisão custa em fidelidade. A tabela diz os números; o gráfico abaixo torna o trade-off visível.
| Precisão | Bits/peso | Pesos (284 B) | Cabe em 128 GB? | O que você ganha / perde |
|---|---|---|---|---|
| FP16 | 16 | 568 GB | ✗ não (4,4× o teto) | Fidelidade total · impossível local |
| Q8 | 8 | 284 GB | ✗ não (2,2× o teto) | Quase sem perda · ainda grande demais |
| Q4_K | ~4 | 159 GB | ✗ não (1,2× o teto) | Sweet spot — mas só num Mac de 256 GB |
| Q2_K | ~2 | 71 GB (81 real) | ✓ sim · única que entra | Cabe! · math/código/tools degradam — salvo a quant assimétrica do DS4 |
O gráfico de barras empilha as duas dimensões: a altura é a memória; a cor da etiqueta é o veredito. Só a barra da Q2 cruza para baixo da linha dos 128 GB:
O orçamento dos 128 GB — onde cada GB vai (Q2)
Caber os pesos é metade da história. Os 128 GB são um orçamento repartido entre pesos, KV cache, sistema operacional e a folga obrigatória. Veja a divisão típica rodando o DS4 q2 com contexto moderado:
Fixe os conceitos (flashcards)
Clique pra virar. Tente lembrar a resposta antes de virar — recuperação ativa fixa mais que reler.
Revisão cumulativa — recupere de memória
Antes de clicar: responda de cabeça. As quatro opções têm o mesmo tamanho de propósito — sem pista pela forma.