להפעיל בינה מלאכותית מקומית — והיכן ש'מקומי' הוא מיתוס
הקלד ollama בטרמינל שלך היום. מה שמופעל אינו מודל מקומי.
החל מגרסה 0.32.0 מ-11 ביולי 2026, הפקודה הפשוטה הזו פותחת סוכן (agent) — ובהערות השחרור (release notes) של Ollama עצמה כתוב באיזה: “Chat, Code, & Work (glm-5.2:cloud)”. מודל ענן. הכלי הפופולרי ביותר לבינה מלאכותית מקומית שולח אותך לרשת כברירת מחדל.
זו לא שערורייה, אלא החלטת מוצר, ואפשר לכבות אותה. אבל זו הפתיחה המושלמת לרשומה הזו. כי “מקומי” הפך למילה שצריך לבדוק, לא להאמין לה.
למה בכלל לעשות את זה
בואו נתחיל במה שבאמת מחזיק מעמד — וזה לא הכסף.
אם אתה מפעיל בינה מלאכותית על השרתים שלך אך ורק למטרותיך שלך, אז לפי עמדת רשויות הגנת המידע הגרמניות, מערכת יחסי המעבד (Auftragsverarbeitung) נעלמת. אתה הבקר היחיד (Sole Controller). אין הסכם עיבוד נתונים לפי סעיף 28(3) ל-GDPR, אין שרשרת תת-מעבדים, אין העברה למדינה שלישית, ואין החלטת נאותות (adequacy decision) שעלולה להתמוטט בשנה הבאה.
זו הנקודה שכדאי להבין: עיבוד מקומי הוא לא הפחתת סיכון. זו הסרה מבנית של שרשרת שלמה של חובות. רשויות הפיקוח ממליצות במפורש על עיבוד מקומי, למשל לצורך אימון נוסף ו-fine-tuning של מודלים.
והחשש הנפוץ שהפעלת בינה מלאכותית משלך גוררת הביתה חובות רגולטוריות פשוט לא רלוונטי למשתמש הפרטי: לפי סעיף 2(10), חוק ה-AI (AI Act) כלל לא חל על שימוש פרטי טהור, לא-מקצועי, וסעיף 2(12) פוטר באופן כללי מערכות קוד פתוח חינמיות.
(זהו תיאור של הנחיות רשויות וטקסט חוקי נכון ל-24 ביולי 2026 — ואינו ייעוץ משפטי. במקרה עסקי ממשי, יש להפנות זאת לממונה הגנת המידע שלך.)
מה נכנס לכרטיס שלך
המידע הכי הוגן על VRAM שזמין באופן רשמי הוא גדלי הקבצים בספרייה של Ollama. בגדול: אתה צריך בערך כמות זיכרון וידאו כגודל הקובץ, בתוספת מרווח ביטחון.
| מודל | גודל (Q4) | נכנס ל- |
|---|---|---|
| Gemma 4, 12B | 7.6 GB | כרטיס 8 GB, בקושי |
| gpt-oss-20b | מיועד ל-16 GB | כרטיס 16 GB |
| Qwen3.6-27B | 17 GB | כרטיס 24 GB |
| Gemma 4, 31B | 20 GB | כרטיס 24 GB |
| Laguna XS 2.1 (q4) | 20 GB | כרטיס 24 GB |
| Qwen3.6-35B | 24 GB | 24 GB, צפוף מאוד |
סף הכניסה הריאלי הוא אפוא כרטיס 16 GB. אצל קמעונאי גרמני גדול, RTX 5060 Ti עם 16 GB הופיע במחיר 555.85 € (מחיר מבצע), הכרטיס הרגיל הזול ביותר בגודל 16 GB עמד על 559.64 €. הכרטיס בגודל 32 GB (RTX 5090) עולה כמה מונים מזה — 4,248.99 €.
שני דברים בעניין הזה כמעט אף פעם לא מוצגים נכון:
קוונטיזציה (Quantisation) לא רק מקטינה מודלים, היא גם מאיצה אותם. בדוגמה הסטנדרטית של Llama-3.1-8B, הגרסה ב-4 ביט מייצרת 71.93 טוקנים בשנייה, לעומת 29.17 בגרסה ב-16 ביט — פי 2.5. הסיבה: יצירת טקסט מוגבלת ברוחב פס זיכרון (memory-bandwidth-bound). פחות ביטים אומר פחות מה לקרוא. התפיסה הרווחת שקוונטיזציה היא רק פשרת איכות שמקבלים רק בגלל מחסור במקום — פשוט לא נכונה.
החשמל לא ממש משנה. בשעה אחת ביום בעומס מלא, ה-5060 Ti עולה כ-2.22 € בחודש, וה-5090 כ-7.09 € — לפי מחיר החשמל הרשמי לבתי אב בגרמניה, 40.55 סנט לקילוואט-שעה. גם בארבע שעות ביום זה רק 8.88 € ו-28.35 €. הטענה ש”בינה מלאכותית מקומית לא משתלמת בגלל עלויות חשמל” יורדת מהפרק. ההחלטה נופלת אך ורק על מחיר הרכישה.
החשבון שכמעט אף אחד לא כותב
ומחיר הרכישה מכריע נגדך.
555.85 € שווים — לפי שער החליפין בתאריך הבדיקה — לכ-253 מיליון טוקני פלט ב-Gemini 3.5 Flash-Lite. ב-Claude Haiku 4.5 מדובר ב-126 מיליון, ב-Claude Sonnet 5 עדיין 63 מיליון, וב-GPT-5.6 Sol 21 מיליון נכבדים.
עצור רגע עם המשמעות של זה. מישהו שמייצר 5,000 טוקנים ביום — וזה כבר שימוש יומי אינטנסיבי — יזדקק לכ-138 שנה כדי לצרוך 253 מיליון טוקנים.
כביטוי של נקודת איזון (break-even): כרטיס הכניסה מחזיר את עצמו אחרי כ-71 חודשים, שש שנים, בהוצאת API חודשית של 10 €. ב-25 € — אחרי כשנתיים טובות. רק מ-50 € בחודש זה נעשה מעניין — פחות משנים עשר חודשים. ה-5090 עם 50 € בחודש לוקח כ-שמונה שנים.
בינה מלאכותית מקומית כמעט לעולם אינה האופציה הזולה יותר מבחינה כלכלית. מי שמצדיק זאת ב”זה חוסך כסף לטווח ארוך” בדרך כלל טועה בחישוב. אתה קונה אותה בשביל ריבונות על הנתונים (data sovereignty) — שהיא ערך אמיתי, אבל אחר.
יוצא דופן הוגן אחד: אם דרישות ציות כבר מחייבות מגורי נתונים אירופיים (European data residency), שני הספקים האמריקאיים הגדולים גובים בדיוק תוספת של 10% — OpenAI קוראת לזה “a 10% uplift”, Anthropic מציינת מקדם של 1.1. זה מזיז את החשבון מעט, אבל לא דרמטית.
פער היכולת — והתרגיל שבתוך המספר
הרבה דברים מתבלבלים כאן, וההבחנה קריטית.
“מודלים פתוחים כמעט השיגו את הפער” זה נכון — במדד האינטליגנציה (Intelligence Index) של Artificial Analysis, Kimi K2.6 ו-MiMo V2.5 Pro נמצאים ב-54 נקודות, DeepSeek V4 Pro ב-52, לעומת 60 של GPT-5.5 בראש. שנה קודם לכן הפער היה רחב בהרבה.
“אני יכול להריץ את זה בבית” היא טענה שונה, על מודלים שונים. ל-Kimi K2.6 יש טריליון פרמטרים. ל-DeepSeek V4 Pro — 1.6 טריליון. אלה מודלים של מרכזי נתונים (datacentre). הם פתוחים — אבל זה לא הופך אותם לניתנים להרצה על כרטיס המסך שלך.
מה שבאמת נכנס לכרטיס בודד נמצא הרבה יותר מאחור: Qwen3.6-27B מקבל 37 נקודות מדד — מקום ראשון במחלקת הגודל שלו, אבל 37 מול 60. gpt-oss-20b נמצא ב-15.
ובבדיקת ההצלבה בהשוואה עיוורת (blind comparison) הפער עוד חד יותר: בטבלת המובילים (leaderboard) של LMArena אין אפילו מודל פתוח אחד בין ה-15 המובילים. המודל הפתוח הטוב ביותר נמצא במקום 29.
לשם ההגינות: המתודולוגיה של הזירה הזו תועדה ונבחנה בביקורת (“The Leaderboard Illusion”), בין היתר משום שחלק גדול מאוד מהנתונים מגיע ממספר קטן של ספקים מסחריים. עם זאת, הביקורת מגיעה ממחברים שעצמם קרובים לספק מודלים. שני הדברים צריכים לעמוד זה לצד זה.
המסקנה שלי: עבור סיכום, ניסוח מחדש, מבנה, וקידוד פשוט, מודל 27B על כרטיס 24 GB מספיק לגמרי. במקרים הקשים — חשיבה ארוכה, משימות מקוננות, עבודה אג’נטית (agentic) — מרגישים את 23 הנקודות האלה מיד.
היכן ש’מקומי’ אינו מקומי
זה החלק שאף מדריך לא כותב, כי הוא לא נוח.
הקריאה ברירת המחדל של Ollama. ראו למעלה: החל מ-v0.32.0, ollama מפעילה סוכן על מודל ענן. מודלי ענן נמצאים באותה רשימת ספרייה כמו מודלים מקומיים, ומובחנים רק על ידי סיומת התג (tag) — gemma4:31b רץ על המכונה שלך, gemma4:31b-cloud לא. הבדל של תו אחד.
חיפוש האינטרנט של הסוכן רץ דרך השרתים של Ollama עצמה ודורש חשבון ומפתח API.
גם שימוש מקומי טהור מייצר מטא-דאטה. מדיניות הפרטיות של Ollama מפרידה בין הדברים בבירור — תוכן לא נאסף באופן מקומי, ובמפורש: “We do not collect, store, transmit, or have access to your prompts, responses, model interactions, or other content you process locally.” אבל מטא-דאטה על המכשיר והשימוש כן נאספת.
LM Studio מצהירה על עצמה כנטולת טלמטריה (telemetry-free), ובמקביל מציינת בגלוי את חמש הפונקציות שדורשות אינטרנט: חיפוש מודלים, הורדת מודלים, סטטיסטיקות קטלוג, הורדות runtime, בדיקת עדכונים. זו הגרסה למופת — הגבול כתוב בתיעוד.
ואצל אחד המודלים הידועים ביותר, הצעד הראשון לקראת ריבונות הוא מסירת הזהות שלך: כדי להוריד את המשקלים ה”פתוחים” של Llama 4, Meta דורשת את שמך המשפטי המלא ותאריך הלידה שלך. רישיון ה-Llama ממילא אינו רישיון קוד פתוח אמיתי — אם עוברים 700 מיליון משתמשים פעילים חודשית, צריך לבקש רשות מ-Meta, שניתנת לפי שיקול דעתה הבלעדי.
איזה מודל לבחור אם הרישיון חשוב לך
אם “פתוח” אמור להיות באמת פתוח, הרישיון הוא הקריטריון הראשון — ומשהו כאן השתנה שכמעט כל מדריך ישן עדיין טועה בו.
Gemma 4 נמצא תחת רישיון Apache 2.0 מאז השחרור שלו ב-31 במרץ 2026 — דף הרישיון נושא את הטקסט המלא, ללא שינויים. לכל הדורות הקודמים של Gemma היה רישיון בית מגביל, שבו Google אף שמרה לעצמה את הזכות להגביל שימוש מרחוק. זה עדיין תקף ל-Gemma 3 וישן יותר. אם אתה קורא מדריך שאומר “ל-Gemma יש רישיון משלה” — אתה קורא מדריך מיושן.
Qwen3.6-27B נמצא תחת Apache 2.0 ללא שינויים וללא סעיפים נוספים — ובו-זמנית הוא המודל החזק ביותר במחלקת הגודל שלו. אם הייתי צריך להמליץ על דבר אחד לכרטיס 24 GB, זה היה זה.
gpt-oss-20b גם הוא תחת Apache 2.0, ולפי כרטיס המודל (model card) שלו, מיועד במפורש ל-16 GB — נקודת הכניסה הנוחה ביותר על כרטיס הכניסה.
מה אתה מוותר עליו
כדי שזה לא יהפוך לפרסומת, הנה המחיר האמיתי:
מהירות. כרטיס כניסה הוא לא מרכז נתונים. עם הקשרים ארוכים וחשיבה ארוכה, אתה מחכה.
יכולת. 37 מול 60 נקודות מדד זו לא טעות עיגול. המודל המקומי שלך מתמודד גרוע יותר עם המשימות הקשות.
תחזוקה. דרייברים, קוונטיזציות, עדכוני מודלים, תלויות שבורות. זו עבודה שאף אחד לא מחייב אותך עליה עם API, כי מישהו אחר עושה אותה.
ופער אחד שלא הצלחתי לסגור: לא מצאתי שום הצהרה בתיעוד הרשמי של Ollama או LM Studio לגבי האם משקלי מודלים שהורדו מאומתים קריפטוגרפית מבחינת מקור (provenance). עבור קובץ שאתה מריץ על המכונה שלך, זה פרט שהייתי שמח לקבל.
המסקנה שלי
אל תקנה כרטיס מסך כדי לחסוך כסף. החשבון כמעט אף פעם לא יוצא, ומי שמראה לך אחרת שיפר באופן לא מציאותי או את השימוש שלך או את מחיר הכרטיס.
קנה כרטיס אם חשוב לך שטקסטים מסוימים לעולם לא יצאו מהבית שלך — תיקי לקוחות, רשומות מטופלים, כתבי יד, חוזים, כל דבר שבו השאלה “איפה זה נמצא עכשיו?” זקוקה לתשובה אמיתית. לשם כך, בינה מלאכותית מקומית היא לא הפתרון הזול יותר, אלא הפתרון הנקי היחיד — כי אז שום צד שלישי לא נמצא בשרשרת בכלל.
ואם אתה רק מתחיל: תתחיל בקטן. כרטיס 16 GB, gpt-oss-20b או Gemma 4 בגודל בינוני, ותשקיע שבוע בהתבוננות כנה במה שאתה באמת משתמש בו. אחרי זה תדע אם כרטיס 24 GB שווה את זה — עדיף מלנחש מראש.
הכלים סביב כל זה נמצאים באינדקס המתעדכן שלי של 137 כלי בינה מלאכותית; איזה מהמודלים המסחריים טוב למה נמצא בהשוואה בין ChatGPT, Claude ו-Gemini.
מקורות
כולם נבדקו ב-24 ביולי 2026. מחירים, מצבי מודלים ורישיונות משתנים; מחירי חומרה הם מחירי קמעונאים נכון לתאריך הבדיקה.
- Qwen3.6 · Gemma 4 · gpt-oss-20b — כרטיסי מודל וטקסטי רישיון
- רישיון Llama ותנאי הורדה — Meta
- ספריית מודלים (גדלי קבצים לפי קוונטיזציה) · הערות שחרור v0.32.0 · מדיניות פרטיות — Ollama
- תיעוד (פעולה במצב לא מקוון, טלמטריה) — LM Studio
- השוואת קוונטיזציה — llama.cpp
- מפרטי GeForce RTX 50 — NVIDIA
- מחירי חשמל לבתי אב — הלשכה הפדרלית הגרמנית לסטטיסטיקה (40.55 סנט/קוט”ש, מחצית שנייה 2025)
- מדד האינטליגנציה (Intelligence Index) — Artificial Analysis · טבלת המובילים — LMArena
- הנחיות בנושא בינה מלאכותית והגנת מידע — ועידת הגנת המידע הגרמנית (DSK)
- חוק ה-AI (AI Act): תקנה (EU) 2024/1689, סעיף 2(10) וסעיף 2(12)
- תמחור API: OpenAI · Google · Anthropic
אם משהו כאן נראה לך מיושן או שגוי: כתוב לי.
תגובות
התחברו כדי להגיב, לאהוב ולשמור. התחברות →
אין עדיין תגובות. כתבו את הראשונה.