Cheat-Sheet: RAM → Model Tanlash va Kvantizatsiya
Modul 3, Dars 3.3 uchun material. "Kompyuterim nimani ko‘taradi?" degan savolga javob.
Xotira arifmetikasi
Kerakli xotira ≈ parametrlar soni × bayt/parametr + 2–4 GB (kontekst va tizim)
| Format | Bayt/parametr | 7B model | 32B model | 70B model |
|---|---|---|---|---|
| FP16 (to‘liq) | 2 | ~14 GB | ~64 GB | ~140 GB |
| Q8 | ~1 | ~7–8 GB | ~32 GB | ~70 GB |
| Q4 | ~0,5 | ~4–5 GB | ~18 GB | ~40 GB |
Kvantizatsiya darajalari
Kvantizatsiya — model og‘irligini siqib kichraytirish: parametrlar kamroq bit bilan saqlanadi.
| Daraja | Sifat | Qachon tanlash |
|---|---|---|
| Q8 | Deyarli to‘liq | Xotirangiz mo‘l bo‘lsa |
| Q4_K_M | Yaxshi muvozanat | Standart tanlov — shundan boshlang |
| Q3 va past | Sezilarli yo‘qotish | Faqat xotira juda tor bo‘lsa, ehtiyot bo‘ling |
GGUF — kvantlangan modellarning fayl formati; Ollama ham, LM Studio ham aynan shu bilan ishlaydi.
"Xotiram → modelim" jadvali (Q4 asosida)
| Xotira (RAM / birlashgan) | Tavsiya model hajmi | Nima kutish mumkin |
|---|---|---|
| 8 GB | 3–4B | Engil vazifalar, oddiy savol-javob |
| 16 GB | 7–8B | Kundalik ishga minimal qulay daraja |
| 32 GB | 14B (ehtiyotkorlik bilan 32B) | Jiddiy kodlash yordamchisi |
| 64 GB | 32B bemalol, 70B Q4 chegarada | Professional daraja |
| 96–128 GB | 70B+ | Ish stansiyasi / jamoa serveri |
Tezlikka ta’sir qiladigan narsalar
- VRAM (GPU xotirasi) — model to‘liq sig‘sa, eng tez rejim shu.
- VRAM yetmasa → bir qismi RAM/CPU'ga o‘tadi → sezilarli sekinlashadi (ishlaydi, lekin "tomchilaydi").
- Apple Silicon (M1–M4) — birlashgan xotira: RAM va VRAM bitta hovuz, shuning uchun 32GB Mac lokal AI'da 32GB'lik GPU kabi ishlaydi.
- SSD shart — model har yuklanganda diskdan o‘qiladi: NVMe SSD bo‘lsa soniyalar, HDD bo‘lsa — azob.
Oltin qoidalar
Q4 — do‘stingiz: hajm bilan sifatning oltin o‘rtaligi, shundan boshlang.
Model fayli + 2–4GB < bo‘sh xotira — bu shart bajarilmasa, kichikroq hajmni tanlang.
Ikkilanib qolsangiz: kichikroq model + Q8 ko‘pincha kattaroq model + Q3 dan yaxshi ishlaydi.