Bugün terminaline ollama yaz. Başlayan şey yerel bir model değil.

11 Temmuz 2026 tarihli 0.32.0 sürümünden beri, sadece bu komut bir ajan açıyor — ve Ollama’nın kendi sürüm notlarında neyle çalıştığı yazıyor: “Chat, Code, & Work (glm-5.2:cloud)”. Bir bulut modeli. Yerel yapay zekâ için en popüler araç, varsayılan çağrıda seni doğrudan internete gönderiyor.

Bu bir skandal değil, bir ürün kararı, ve kapatılabiliyor. Ama bu yazı için mükemmel bir açılış. Çünkü “yerel” artık inanılacak değil, kontrol edilecek bir kelime haline geldi.

Bunu neden yaparsın ki

Asıl önemli olandan başlayalım — ve bu para değil.

Bir yapay zekâyı yalnızca kendi amaçların için kendi sunucularında çalıştırırsan, Alman Veri Koruma Konferansı’nın görüşüne göre veri işleyicilik ilişkisi ortadan kalkar. Tek başına veri sorumlusu sen olursun. GDPR Madde 28(3) uyarınca veri işleme sözleşmesi yok, alt-yüklenici zinciri yok, üçüncü ülkeye aktarım yok, gelecek yıl çökebilecek bir yeterlilik kararı yok.

Anlaşılması gereken nokta şu: Yerel işleme bir risk azaltma değildir. Bütün bir yükümlülük zincirinin yapısal olarak ortadan kalkmasıdır. Denetim makamları yerel işlemeyi — örneğin ek eğitim ve ince ayar (fine-tuning) için — açıkça tavsiye ediyor.

Ve kendi yapay zekânı işletmenin evine düzenleyici yükümlülükler getireceğine dair yaygın kaygı, özel kullanıcıyı hiç ilgilendirmiyor: AI Act, Madde 2(10) uyarınca tamamen özel, mesleki olmayan kullanım için hiç geçerli değildir; Madde 2(12) ise özgür açık kaynaklı sistemleri genel olarak muaf tutar.

(Bu, 24 Temmuz 2026 itibarıyla yürürlükteki makam rehberliği ve yasa metinlerinin bir aktarımıdır — hukuki tavsiye değildir. Somut bir işletme durumu için bu konu veri koruma görevlisine aittir.)

Ekran kartına ne sığar

Resmi olarak mevcut en dürüst VRAM bilgisi, Ollama’nın kütüphanesindeki dosya boyutlarıdır. Kabaca: Dosya ne kadar büyükse, o kadar ekran kartı belleğine ihtiyacın var, artı biraz pay.

ModelBoyut (Q4)Sığdığı yer
Gemma 4, 12B7,6 GB8 GB kart, zar zor
gpt-oss-20b16 GB için tasarlandı16 GB kart
Qwen3.6-27B17 GB24 GB kart
Gemma 4, 31B20 GB24 GB kart
Laguna XS 2.1 (q4)20 GB24 GB kart
Qwen3.6-35B24 GB24 GB, çok sınırlı

Gerçekçi giriş eşiği böylece 16 GB’lık bir kart. Büyük bir Alman perakendecide 16 GB’lık bir RTX 5060 Ti 555,85 €‘ya (kampanya fiyatı) satılıyordu, en ucuz standart 16 GB kart ise 559,64 €‘ya. 32 GB’lık kart (RTX 5090) 4.248,99 € ile bunun kat kat üzerinde.

Bununla ilgili nadiren doğru anlatılan iki şey:

Nicelleştirme (quantization) modelleri sadece küçültmekle kalmaz, hızlandırır da. Standart örnek Llama-3.1-8B’de 4-bit varyant saniyede 71,93 token üretirken, 16-bit varyant sadece 29,17 üretiyor — 2,5 kat fark. Nedeni: Metin üretimi bellek bant genişliği tarafından sınırlanır. Daha az bit, okunacak daha az veri demek. Nicelleştirmenin sadece yer darlığından kabul edilen saf bir kalite tavizi olduğu yönündeki yaygın kanı, bu haliyle doğru değil.

Elektrik önemli değil. Günde bir saat tam yük altında çalıştığında 5060 Ti ayda yaklaşık 2,22 €‘ya, 5090 ise yaklaşık 7,09 €‘ya mal oluyor — resmi Alman konut elektrik fiyatı olan kilovatsaat başına 40,55 sent üzerinden hesaplandı. Günde dört saatte bile bu rakamlar 8,88 € ve 28,35 €. “Yerel yapay zekâ elektrik maliyeti yüzünden karşılığını vermiyor” argümanı böylece masadan kalkıyor. Karar sadece satın alma fiyatına göre veriliyor.

Neredeyse kimsenin yazmadığı hesap

Ve satın alma fiyatı senin aleyhine karar veriyor.

555,85 €, erişim tarihindeki kurla, Gemini 3.5 Flash-Lite’ta yaklaşık 253 milyon çıktı token’ına karşılık geliyor. Claude Haiku 4.5’te 126 milyon, Claude Sonnet 5’te hâlâ 63 milyon, GPT-5.6 Sol’da ise en azından 21 milyon.

Bunun ne demek olduğunu bir düşün. Günde 5.000 token üreten biri — ki bu zaten yoğun bir günlük kullanım — 253 milyon token’ı tüketmek için hesapça yaklaşık 138 yıla ihtiyaç duyardı.

Başabaş noktası olarak ifade edersek: Giriş seviyesi kart, aylık 10 € API harcamasında yaklaşık 71 ay, yani altı yıl sonra kendini amorti ediyor. 25 €‘da iyi iki yıl sonra. Ancak ayda 50 €‘da, on iki aya yakın bir süreyle ilginç hale geliyor. 5090 ise ayda 50 €‘da yaklaşık sekiz yıla ihtiyaç duyuyor.

Yerel yapay zekâ mali açıdan neredeyse hiçbir zaman daha ucuz seçenek değildir. Bunu “uzun vadede para biriktirir” diye gerekçelendiren biri, kural olarak yanlış hesap yapıyordur. Onu veri egemenliği için satın alırsın — ve bu gerçek bir değerdir, ama başka türden bir değer.

Dürüst bir istisna: Uyumluluk gerekçesiyle zaten Avrupa veri yerleşimine ihtiyaç duyan biri, iki büyük ABD sağlayıcısında da tam olarak %10 ek ücret ödüyor — OpenAI buna “a 10% uplift” diyor, Anthropic ise 1,1 katsayısından söz ediyor. Bu, hesabı hafifçe kaydırıyor ama dramatik biçimde değil.

Performans farkı — ve sayının içindeki hile

Burada çok şey birbirine karıştırılıyor ve fark belirleyici.

“Açık modeller neredeyse yetişti” doğru — Artificial Analysis’in Intelligence Index’inde Kimi K2.6 ve MiMo V2.5 Pro 54 puanda, DeepSeek V4 Pro 52 puanda, zirvedeki GPT-5.5’in 60 puanına karşılık. Bir yıl önce fark çok daha büyüktü.

“Bunu evde çalıştırabilirim” ise farklı modeller hakkında farklı bir iddia. Kimi K2.6’nın bir trilyon parametresi var. DeepSeek V4 Pro’nun 1,6 trilyon. Bunlar veri merkezi modelleri. Açıklar — ama bu, ekran kartında çalışabilecekleri anlamına gelmez.

Tek bir karta gerçekten sığan modeller ise daha geride: Qwen3.6-27B 37 indeks puanına ulaşıyor — kendi boyut sınıfında 1. sırada, ama yine de 60’a karşı 37. gpt-oss-20b ise 15’te.

Kör karşılaştırmadaki kontrol testi ise daha da net: LMArena sıralamasında ilk 15’te tek bir açık model bile yok. En iyi açık model 29. sırada.

Adil olmak gerekirse şunu da eklemek lazım: Bu arenanın metodolojisi belgeli biçimde eleştirildi (“The Leaderboard Illusion”), bir nedeni de verinin çok büyük bir kısmının az sayıda ticari sağlayıcıya ait olması. Ancak bu eleştiri, kendisi bir model sağlayıcısına yakın olan yazarlardan geliyor. İkisi de yan yana durmalı.

Buradaki değerlendirmem: Özetleme, yeniden ifade etme, yapılandırma, basit kodlama için 24 GB’lık bir kartta 27B’lik bir model fazlasıyla yeterli. Zor durumlarda — uzun akıl yürütme, iç içe geçmiş görevler, ajan (agentic) işler — 23 puanlık farkı hemen hissedersin.

”Yerel”in yerel olmadığı yer

Bu, hiçbir rehberin yazmadığı kısım, çünkü rahatsız edici.

Ollama’nın varsayılan çağrısı. Yukarıda görüldüğü gibi: v0.32.0’dan beri ollama bir bulut modeliyle bir ajan başlatıyor. Bulut modelleri, yerel olanlarla aynı kütüphane listesinde yer alıyor, sadece etiketteki ek ile ayrılıyorlar — gemma4:31b senin makinende çalışır, gemma4:31b-cloud çalışmaz. Tek bir karakterlik fark.

Ajandaki web araması Ollama’nın kendi sunucuları üzerinden çalışıyor ve bir hesap ile bir API anahtarı gerektiriyor.

Tamamen yerel kullanımda bile meta veri oluşuyor. Ollama’nın gizlilik politikası bunu net biçimde ayırıyor — içerikler yerelde toplanmıyor, açıkça şöyle deniyor: “We do not collect, store, transmit, or have access to your prompts, responses, model interactions, or other content you process locally.” Ama cihaz ve kullanım meta verileri toplanıyor.

LM Studio telemetri içermediğini belirtiyor ve aynı zamanda internete ihtiyaç duyan beş işlevi açıkça sıralıyor: model arama, model indirme, katalog istatistikleri, çalışma zamanı (runtime) indirmeleri, güncelleme kontrolü. Bu örnek alınacak bir yaklaşım — sınır belgelerde açıkça yazıyor.

Ve en tanınmış modellerden birinde egemenliğe giden ilk adım, kimliğini teslim etmek: “Açık” Llama 4 ağırlıklarını indirmek için Meta, tam yasal adını ve doğum tarihini istiyor. Llama lisansı zaten bir açık kaynak lisansı değil — ayda 700 milyon aktif kullanıcıyı aşan biri, Meta’dan kendi takdirine bağlı olarak verilen bir izin istemek zorunda.

Lisans senin için önemliyse hangi modeli seçmelisin

“Açık” gerçekten açık anlamına gelecekse, lisans ilk kriterdir — ve burada, neredeyse her eski rehberde hâlâ yanlış yazan bir şey değişti.

Gemma 4, 31 Mart 2026’daki çıkışından beri Apache 2.0 lisansı altında — lisans sayfası tam, değiştirilmemiş metni taşıyor. Önceki tüm Gemma nesillerinde Google’ın kullanımı uzaktan kısıtlama hakkını bile sakladığı kısıtlayıcı bir kendi lisansı vardı. Gemma 3 ve öncesi için bu hâlâ geçerli. “Gemma’nın kendine özgü bir lisansı var” diyen bir rehber okuyorsan, güncelliğini yitirmiş bir rehber okuyorsun demektir.

Qwen3.6-27B, ek madde içermeyen, değiştirilmemiş bir Apache 2.0 lisansı altında — ve aynı zamanda kendi boyut sınıfının en güçlü modeli. 24 GB’lık bir kart için bir tane önermem gerekseydi, bu olurdu.

gpt-oss-20b de Apache 2.0 altında ve model kartına göre açıkça 16 GB için tasarlanmış — giriş seviyesi kartta en rahat başlangıç.

Bunun karşılığında kaybettiklerin

Bunun bir reklama dönüşmemesi için, dürüst bedeli:

Hız. Giriş seviyesi bir kart veri merkezi değil. Uzun bağlamlarda ve uzun akıl yürütmede beklersin.

Yetenek. 60’a karşı 37 indeks puanı bir yuvarlama hatası değil. Zor görevleri yerel modelin daha kötü yapar.

Bakım. Sürücüler, nicelleştirmeler, model güncellemeleri, bozuk bağımlılıklar. Bu, bir API kullanırken kimsenin sana fatura etmediği bir iş, çünkü onu başkası yapıyor.

Ve kapatamadığım bir boşluk: Ollama’nın ve LM Studio’nun resmi belgelerinde, indirilen model ağırlıklarının kaynağının kriptografik olarak doğrulanıp doğrulanmadığına dair bir ifade bulamadım. Kendi bilgisayarında çalıştırdığın bir dosya için, bunu bilmek isterdim.

Benim değerlendirmem

Para biriktirmek için ekran kartı alma. Hesap neredeyse hiç tutmuyor, ve sana başka türlü hesap yapan biri ya senin tüketimini ya da kart fiyatını süslemiştir.

Bazı metinlerin evinden çıkmaması senin için önemliyse satın al — müvekkil verileri, hasta kayıtları, el yazmaları, sözleşmeler, “bu şu an nerede duruyor?” sorusunun gerçek bir cevaba ihtiyaç duyduğu her şey. Bunun için yerel yapay zekâ daha ucuz değil, tek temiz çözümdür, çünkü o zaman zincirde başka bir üçüncü taraf kalmaz.

Ve başlıyorsan: Küçük başla. 16 GB’lık bir kart, gpt-oss-20b veya orta boy bir Gemma 4, ve bir hafta boyunca dürüstçe gerçekten neyi kullandığına bak. Ondan sonra 24 GB’lık kartın değip değmeyeceğini bilirsin — önceden tahmin etmekten daha iyi.

Bunun etrafındaki araçlar, sürekli güncellediğim 137 yapay zekâ aracından oluşan dizinde; hangi ticari modelin ne için iyi olduğu ise ChatGPT, Claude ve Gemini karşılaştırmasında.

Kaynaklar

Tümü 24 Temmuz 2026 tarihinde kontrol edildi. Fiyatlar, model sürümleri ve lisanslar değişebilir; donanım fiyatları erişim tarihindeki perakendeci fiyatlarıdır.

Burada bir şeyin güncelliğini yitirdiğini ya da yanlış olduğunu düşünüyorsan: bana yaz.