امروز ollama را در ترمینال خود تایپ کن. آنچه اجرا می‌شود یک مدل محلی نیست.

از نسخهٔ 0.32.0 مورخ 11 جولای 2026، همین دستور به‌تنهایی یک ایجنت باز می‌کند — و در یادداشت‌های انتشار خود Ollama نوشته شده با چه چیزی: «Chat, Code, & Work (glm-5.2:cloud)». یک مدل ابری. محبوب‌ترین ابزار برای هوش مصنوعی محلی، در فراخوانی پیش‌فرض تو را به شبکه می‌فرستد.

این رسوایی نیست، بلکه یک تصمیم محصولی است و می‌توان آن را خاموش کرد. اما این آغازی عالی برای این مطلب است. چون «محلی» این روزها کلمه‌ای است که باید بررسی‌اش کرد، نه اینکه باورش کرد.

چرا اصلاً این کار را انجام می‌دهی

بیا با چیزی شروع کنیم که واقعاً وزن دارد — و آن پول نیست.

اگر یک هوش مصنوعی را روی سرورهای خودت، منحصراً برای مقاصد خودت اجرا کنی، طبق دیدگاه کنفرانس حفاظت از داده‌های آلمان (DSK)، پردازش داده به‌نمایندگی از بین می‌رود. تو تنها مسئول (کنترل‌کننده) هستی. نه قرارداد پردازش داده طبق مادهٔ 28 بند 3 GDPR، نه زنجیرهٔ پیمانکار فرعی، نه انتقال داده به کشور ثالث، نه تصمیم کفایتی که سال بعد ممکن است فرو بریزد.

این نکته‌ای‌ست که باید فهمید: پردازش محلی کاهش ریسک نیست. بلکه حذف ساختاری یک زنجیرهٔ کامل از تعهدات است. نهادهای نظارتی صراحتاً پردازش محلی را توصیه می‌کنند، مثلاً برای آموزش تکمیلی و فاین‌تیونینگ.

و این نگرانی رایج که با هوش مصنوعی خودت، تعهدات نظارتی را به خانه‌ات می‌آوری، برای کاربر خصوصی اصلاً موضوعیت ندارد: قانون هوش مصنوعی (AI Act) طبق مادهٔ 2 بند 10 اصلاً برای استفادهٔ کاملاً خصوصی و غیرحرفه‌ای اعمال نمی‌شود و سیستم‌های متن‌باز رایگان را به‌طور کلی مستثنی می‌کند.

(این بازگویی متون رسمی و قانونی است، وضعیت 24 جولای 2026 — نه مشاورهٔ حقوقی. برای مورد واقعی و کسب‌وکاری، این موضوع را باید با مسئول حفاظت از داده‌ها در میان گذاشت.)

چه چیزی روی کارت گرافیک تو جا می‌شود

صادقانه‌ترین اطلاعات رسمی دربارهٔ VRAM، حجم فایل‌ها در کتابخانهٔ Ollama است. به‌طور تقریبی: به همان مقدار حافظهٔ گرافیکی نیاز داری که حجم فایل است، به‌علاوهٔ کمی فضای اضافه.

مدلحجم (Q4)جا می‌شود روی
Gemma 4، 12B7.6 GBکارت 8 GB، به‌سختی
gpt-oss-20bبرای 16 GB طراحی شدهکارت 16 GB
Qwen3.6-27B17 GBکارت 24 GB
Gemma 4، 31B20 GBکارت 24 GB
Laguna XS 2.1 (q4)20 GBکارت 24 GB
Qwen3.6-35B24 GB24 GB، بسیار به‌سختی

بنابراین آستانهٔ واقع‌بینانهٔ ورود، یک کارت 16 GB است. نزد یک فروشندهٔ بزرگ آلمانی، یک RTX 5060 Ti با 16 GB به قیمت 555.85 یورو (قیمت تخفیف‌دار) بود؛ ارزان‌ترین کارت معمولی 16 GB به قیمت 559.64 یورو. کارت 32 GB (RTX 5090) با 4,248.99 یورو، چند برابر این قیمت است.

دو نکته دربارهٔ این موضوع که به‌ندرت درست بیان می‌شوند:

کوانتیزاسیون مدل‌ها را فقط کوچک‌تر نمی‌کند، بلکه سریع‌تر هم می‌کند. در نمونهٔ استاندارد Llama-3.1-8B، نسخهٔ 4-بیتی 71.93 توکن در ثانیه تولید می‌کند، در حالی‌که نسخهٔ 16-بیتی فقط 29.17 توکن — یعنی ضریب 2.5. دلیلش: تولید متن محدود به پهنای‌باند حافظه است. بیت کمتر یعنی خواندن کمتر. این تصور رایج که کوانتیزاسیون صرفاً یک مصالحهٔ کیفی است که فقط به‌خاطر کمبود فضا انجام می‌شود، این‌طور درست نیست.

برق اهمیتی ندارد. با یک ساعت بار کامل در روز، 5060 Ti حدود 2.22 یورو در ماه هزینه دارد، 5090 حدود 7.09 یورو — محاسبه‌شده با قیمت رسمی برق خانگی آلمان یعنی 40.55 سنت به‌ازای هر کیلووات‌ساعت. حتی با چهار ساعت در روز، این اعداد به 8.88 یورو و 28.35 یورو می‌رسند. بنابراین این استدلال که «هوش مصنوعی محلی به‌خاطر هزینهٔ برق به‌صرفه نیست» از اساس منتفی است. تصمیم فقط و فقط بر اساس قیمت خرید گرفته می‌شود.

محاسبه‌ای که تقریباً هیچ‌کس آن را نمی‌نویسد

و قیمت خرید علیه تو تصمیم می‌گیرد.

555.85 یورو — با نرخ ارز روز دریافت اطلاعات — معادل حدود 253 میلیون توکن خروجی در Gemini 3.5 Flash-Lite است. در Claude Haiku 4.5 این عدد 126 میلیون، در Claude Sonnet 5 هنوز 63 میلیون، و در GPT-5.6 Sol دست‌کم 21 میلیون است.

معنای این را برای خودت روشن کن. کسی که روزانه 5,000 توکن تولید می‌کند — و این خودش استفادهٔ روزانهٔ فشرده‌ای است — از نظر ریاضی برای رسیدن به 253 میلیون توکن به حدود 138 سال نیاز دارد.

به‌عنوان نقطهٔ سربه‌سر: کارت مقدماتی با هزینهٔ ماهانهٔ 10 یورو برای API، بعد از حدود 71 ماه، یعنی شش سال، به‌صرفه می‌شود. با 25 یورو، بعد از حدود دو سال. تازه با 50 یورو در ماه است که با کمی کمتر از دوازده ماه جالب می‌شود. کارت 5090 با 50 یورو در ماه به حدود هشت سال نیاز دارد.

هوش مصنوعی محلی از نظر مالی تقریباً هرگز انتخاب ارزان‌تر نیست. کسی که آن را با «این در درازمدت پول ذخیره می‌کند» توجیه می‌کند، معمولاً محاسبه‌اش اشتباه است. آن را برای حاکمیت داده می‌خرند — و این ارزشی واقعی است، اما ارزشی متفاوت.

یک استثنای صادقانه: کسی که به دلایل انطباق قانونی به‌هرحال به اقامتگاه دادهٔ اروپایی نیاز دارد، نزد هر دو ارائه‌دهندهٔ بزرگ آمریکایی دقیقاً 10٪ هزینهٔ اضافه می‌پردازد — OpenAI آن را «a 10% uplift» می‌نامد، Anthropic ضریب 1.1. این محاسبه را کمی جابه‌جا می‌کند، اما نه به‌طرز چشمگیری.

فاصلهٔ عملکرد — و ترفند پنهان در عدد

اینجا خیلی چیزها با هم قاطی می‌شود، و تفاوت، تعیین‌کننده است.

این‌که «مدل‌های متن‌باز تقریباً به بقیه رسیده‌اند» درست است — در شاخص هوش (Intelligence Index) از Artificial Analysis، Kimi K2.6 و MiMo V2.5 Pro با 54 امتیاز، DeepSeek V4 Pro با 52 امتیاز، در برابر 60 امتیاز GPT-5.5 در صدر قرار دارند. یک سال پیش این فاصله بسیار بیشتر بود.

«می‌توانم این را در خانه اجرا کنم» یک ادعای دیگر دربارهٔ مدل‌های دیگر است. Kimi K2.6 یک تریلیون پارامتر دارد. DeepSeek V4 Pro، 1.6 تریلیون. این‌ها مدل‌های مرکز داده هستند. آن‌ها متن‌باز هستند، اما این باز بودن آن‌ها را روی کارت گرافیک تو قابل‌اجرا نمی‌کند.

آنچه واقعاً روی یک کارت واحد جا می‌شود، عقب‌تر است: Qwen3.6-27B به 37 امتیاز شاخص می‌رسد — رتبهٔ اول در ردهٔ اندازهٔ خودش، اما همان 37 در برابر 60. gpt-oss-20b روی 15 قرار دارد.

و آزمون متقابل در مقایسهٔ کور حتی شفاف‌تر است: در جدول رتبه‌بندی LMArena، در میان 15 مورد برتر هیچ مدل متن‌بازی وجود ندارد. بهترین مدل متن‌باز در رتبهٔ 29 قرار دارد.

از باب انصاف باید گفت: روش‌شناسی این آرنا به‌طور مستند نقد شده است («The Leaderboard Illusion»)، از جمله به این دلیل که سهم بسیار بزرگی از داده‌ها به تعداد کمی ارائه‌دهندهٔ تجاری اختصاص دارد. با این حال، این نقد از نویسندگانی می‌آید که خودشان به یک ارائه‌دهندهٔ مدل نزدیک هستند. هر دوی این‌ها باید کنار هم دیده شوند.

نتیجه‌گیری من: برای خلاصه‌کردن، بازنویسی، ساختاردهی، کدنویسی ساده، یک مدل 27B روی کارت 24 GB کاملاً کافی است. برای موارد سخت — تفکر طولانی، وظایف تودرتو، کار عامل‌محور (agentic) — تفاوت 23 امتیازی را فوراً حس می‌کنی.

جایی که «محلی» محلی نیست

این همان بخشی است که هیچ راهنمایی نمی‌نویسد، چون ناراحت‌کننده است.

فراخوانی پیش‌فرض Ollama. به بالا نگاه کن: از نسخهٔ v0.32.0، ollama یک ایجنت را با یک مدل ابری اجرا می‌کند. مدل‌های ابری در همان فهرست کتابخانه‌ای قرار دارند که مدل‌های محلی، و فقط با پسوند در تگ از هم متمایز می‌شوند — gemma4:31b روی دستگاه تو اجرا می‌شود، gemma4:31b-cloud نه. یک کاراکتر تفاوت.

جست‌وجوی وب در ایجنت از طریق سرورهای خود Ollama انجام می‌شود و یک حساب کاربری و یک کلید API لازم دارد.

حتی در استفادهٔ کاملاً محلی هم متادیتا تولید می‌شود. بیانیهٔ حریم خصوصی Ollama این موضوع را تمیز از هم جدا می‌کند — محتوا به‌صورت محلی جمع‌آوری نمی‌شود، به‌صراحت: «We do not collect, store, transmit, or have access to your prompts, responses, model interactions, or other content you process locally.» اما متادیتای دستگاه و استفاده، بله.

LM Studio عدم وجود تله‌متری را اعلام می‌کند و همزمان صراحتاً پنج قابلیتی را نام می‌برد که به اینترنت نیاز دارند: جست‌وجوی مدل، دانلود مدل، آمار کاتالوگ، دانلود Runtime، بررسی به‌روزرسانی. این نسخهٔ نمونه و قابل‌تحسین است — مرز مشخصاً در مستندات آمده.

و اولین قدم به‌سوی حاکمیت، در یکی از شناخته‌شده‌ترین مدل‌ها، تحویل هویت است: برای دانلود وزن‌های «باز»ِ Llama 4، Meta نام کامل حقوقی و تاریخ تولد را می‌خواهد. مجوز Llama در هر حال یک مجوز متن‌باز واقعی نیست — کسی که از 700 میلیون کاربر فعال ماهانه عبور کند، باید از Meta اجازه بگیرد، اجازه‌ای که به صلاحدید خود آن‌ها اعطا می‌شود.

اگر مجوز برایت مهم است، کدام مدل را باید انتخاب کنی

اگر قرار است «باز» واقعاً به معنای باز باشد، مجوز اولین معیار است — و اینجا چیزی تغییر کرده که در تقریباً هر راهنمای قدیمی‌تری هنوز اشتباه نوشته شده.

Gemma 4 از زمان انتشارش در 31 مارس 2026 تحت مجوز Apache 2.0 قرار دارد — صفحهٔ مجوز، متن کامل و بدون تغییر آن را دارد. تمام نسل‌های پیشین Gemma یک مجوز اختصاصی و محدودکننده داشتند که در آن Google حتی این حق را برای خود محفوظ داشته بود که استفاده را از راه دور محدود کند. برای Gemma 3 و نسخه‌های قدیمی‌تر، این همچنان صادق است. کسی که راهنمایی می‌خواند که می‌گوید «Gemma مجوز خاص خودش را دارد»، در حال خواندن یک راهنمای قدیمی و منسوخ است.

Qwen3.6-27B تحت مجوز بدون تغییر Apache 2.0 و بدون بند اضافی قرار دارد — و همزمان قوی‌ترین مدل در ردهٔ اندازهٔ خودش است. اگر مجبور بودم برای یک کارت 24 GB یکی را توصیه کنم، همین بود.

gpt-oss-20b نیز تحت مجوز Apache 2.0 قرار دارد و طبق کارت مدل (model card) به‌صراحت برای 16 GB طراحی شده — راحت‌ترین نقطهٔ شروع روی کارت مقدماتی.

چه چیزی را در ازای آن از دست می‌دهی

برای اینکه این متن به تبلیغ تبدیل نشود، این هم بهای صادقانه‌اش:

سرعت. یک کارت مقدماتی، مرکز داده نیست. در متن‌های طولانی و تفکر طولانی، باید منتظر بمانی.

توانایی. 37 در برابر 60 امتیاز شاخص، خطای گرد کردن نیست. مدل محلی تو در وظایف سنگین ضعیف‌تر عمل می‌کند.

نگهداری. درایورها، کوانتیزاسیون‌ها، به‌روزرسانی مدل‌ها، وابستگی‌های خراب. این کاری است که در یک API هیچ‌کس آن را از تو حساب نمی‌کند، چون کس دیگری آن را انجام می‌دهد.

و شکافی که نتوانستم آن را ببندم: در مستندات رسمی Ollama و LM Studio هیچ اظهارنظری پیدا نکردم دربارهٔ اینکه آیا وزن‌های مدل دانلودشده از نظر رمزنگاری برای منشأشان بررسی می‌شوند یا نه. برای فایلی که روی دستگاه خودت اجرا می‌کنی، این اطلاعاتی بود که دوست داشتم داشته باشم.

نتیجه‌گیری من

برای صرفه‌جویی در پول، کارت گرافیک نخر. محاسبه تقریباً هرگز درست درنمی‌آید، و کسی که چیز دیگری به تو نشان می‌دهد، یا مصرف تو را یا قیمت کارت را دستکاری کرده.

آن را وقتی بخر که برایت مهم باشد که متن‌های خاصی هرگز از خانه‌ات بیرون نروند — دادهٔ موکل‌ها، دادهٔ بیماران، دست‌نوشته‌ها، قراردادها، هر چیزی که پرسش «الان این کجاست؟» به یک پاسخ واقعی نیاز دارد. برای این هدف، هوش مصنوعی محلی ارزان‌تر نیست، بلکه تنها راه‌حل تمیز است، چون در آن دیگر هیچ شخص ثالثی در زنجیره قرار ندارد.

و اگر می‌خواهی شروع کنی: کوچک شروع کن. یک کارت 16 GB، gpt-oss-20b یا یک Gemma 4 در اندازهٔ متوسط، و یک هفته صادقانه نگاه کن که واقعاً از آن چقدر استفاده می‌کنی. بعد از آن می‌فهمی که آیا کارت 24 GB به‌صرفه است یا نه — بهتر از اینکه از قبل حدس بزنی.

ابزارهای مرتبط با این موضوع در فهرست به‌روز من با 137 ابزار هوش مصنوعی آمده‌اند؛ اینکه کدام مدل تجاری برای چه کاری مناسب است، در مقایسهٔ ChatGPT، Claude و Gemini آمده.

منابع

همه در 24 جولای 2026 بررسی شده‌اند. قیمت‌ها، وضعیت مدل‌ها و مجوزها تغییر می‌کنند؛ قیمت‌های سخت‌افزار، قیمت‌های فروشنده در تاریخ دریافت اطلاعات هستند.

اگر چیزی در اینجا به نظرت قدیمی یا اشتباه می‌آید: برایم بنویس.