Texno Karvon
Bosh sahifa

Cheat-Sheet: RAM → Model Tanlash va Kvantizatsiya

Modul 3, Dars 3.3 uchun material. "Kompyuterim nimani ko‘taradi?" degan savolga javob.

Xotira arifmetikasi

Kerakli xotira ≈ parametrlar soni × bayt/parametr + 2–4 GB (kontekst va tizim)
FormatBayt/parametr7B model32B model70B model
FP16 (to‘liq)2~14 GB~64 GB~140 GB
Q8~1~7–8 GB~32 GB~70 GB
Q4~0,5~4–5 GB~18 GB~40 GB

Kvantizatsiya darajalari

Kvantizatsiya — model og‘irligini siqib kichraytirish: parametrlar kamroq bit bilan saqlanadi.

DarajaSifatQachon tanlash
Q8Deyarli to‘liqXotirangiz mo‘l bo‘lsa
Q4_K_MYaxshi muvozanatStandart tanlov — shundan boshlang
Q3 va pastSezilarli yo‘qotishFaqat xotira juda tor bo‘lsa, ehtiyot bo‘ling

GGUF — kvantlangan modellarning fayl formati; Ollama ham, LM Studio ham aynan shu bilan ishlaydi.

"Xotiram → modelim" jadvali (Q4 asosida)

Xotira (RAM / birlashgan)Tavsiya model hajmiNima kutish mumkin
8 GB3–4BEngil vazifalar, oddiy savol-javob
16 GB7–8BKundalik ishga minimal qulay daraja
32 GB14B (ehtiyotkorlik bilan 32B)Jiddiy kodlash yordamchisi
64 GB32B bemalol, 70B Q4 chegaradaProfessional daraja
96–128 GB70B+Ish stansiyasi / jamoa serveri

Tezlikka ta’sir qiladigan narsalar

  1. VRAM (GPU xotirasi) — model to‘liq sig‘sa, eng tez rejim shu.
  2. VRAM yetmasa → bir qismi RAM/CPU'ga o‘tadi → sezilarli sekinlashadi (ishlaydi, lekin "tomchilaydi").
  3. Apple Silicon (M1–M4) — birlashgan xotira: RAM va VRAM bitta hovuz, shuning uchun 32GB Mac lokal AI'da 32GB'lik GPU kabi ishlaydi.
  4. SSD shart — model har yuklanganda diskdan o‘qiladi: NVMe SSD bo‘lsa soniyalar, HDD bo‘lsa — azob.

Oltin qoidalar

Q4 — do‘stingiz: hajm bilan sifatning oltin o‘rtaligi, shundan boshlang.

Model fayli + 2–4GB < bo‘sh xotira — bu shart bajarilmasa, kichikroq hajmni tanlang.

Ikkilanib qolsangiz: kichikroq model + Q8 ko‘pincha kattaroq model + Q3 dan yaxshi ishlaydi.