Küçük dil modelleri: Her şeyi buluta göndermek zorunda değiliz

Birkaç milyar parametreli modeller artık bir dizüstü bilgisayarda, hatta telefonda çalışabiliyor. Gizlilik, maliyet ve gecikme açısından yerel modellerin ne zaman mantıklı olduğunu ve sınırlarını konuşuyorum.

Yapay zekâ denince akla devasa veri merkezlerinde çalışan modeller geliyor. Ama gündemin diğer yüzünde ters yönde bir hareket var: küçük dil modelleri ve bunları kendi cihazımızda çalıştırmak.

Neden yerel?

  • Gizlilik: Müşteri verisi, iç belgeler ya da kaynak kodu cihazdan hiç çıkmaz.
  • Maliyet: Yüksek hacimli ve basit işlerde (sınıflandırma, özetleme, etiketleme) istek başına ücret ödemezsiniz.
  • Gecikme ve erişilebilirlik: Ağ gidiş-dönüşü yok, internet kesilse de çalışır.

Bunu mümkün kılan ne?

İki gelişme öne çıkıyor. Birincisi, daha iyi eğitim verisi ve damıtma teknikleri sayesinde küçük modellerin belirli görevlerde şaşırtıcı derecede iyi sonuç vermesi. İkincisi niceleme (quantization): ağırlıkları 16 bit yerine 4–8 bitle saklayarak modeli birkaç kat küçültmek. Kalitede genellikle küçük bir kayıp karşılığında bellek ihtiyacı ciddi biçimde düşüyor.

# Örnek: yerel bir modeli komut satırından denemek
ollama run llama3.2 "Bu müşteri yorumunu olumlu/olumsuz olarak sınıflandır: ..."

Sınırlar

Küçük modeller her işi yapamaz. Uzun ve çok adımlı akıl yürütmede, geniş genel kültür gerektiren sorularda ve karmaşık kod üretiminde büyük modellerin gerisinde kalırlar. Ayrıca güncel bilgiye sahip değillerdir; bilgiyi sizin vermeniz gerekir.

Pratik bir ayrım

Benim kullandığım kural basit:

  • Görev dar ve tekrarlı, veri hassas ise: yerel model.
  • Görev açık uçlu, derin akıl yürütme gerekiyor ve veri paylaşılabilir ise: bulut modeli.

Çoğu üründe ikisi birlikte kullanılıyor: basit istekleri yerel model karşılıyor, gerekirse büyük modele aktarılıyor.

Sonuç

Küçük modeller büyük modellerin rakibi değil, tamamlayıcısı. Hangi işin hangi modele gideceğine bilinçli karar vermek, hem maliyeti hem de gizlilik riskini düşürüyor.

İlgili Yazılar