Tape ollama dans ton terminal aujourd’hui. Ce qui démarre n’est pas un modèle local.

Depuis la version 0.32.0 du 11 juillet 2026, la simple commande ouvre un agent — et les notes de version d’Ollama précisent lequel : « Chat, Code, & Work (glm-5.2:cloud) ». Un modèle cloud. L’outil le plus populaire pour l’IA locale t’envoie en ligne par défaut.

Ce n’est pas un scandale, c’est une décision produit, et tu peux la désactiver. Mais c’est l’ouverture parfaite pour cet article. Parce que « local » est devenu un mot qu’il faut vérifier plutôt que croire.

Pourquoi le faire, malgré tout

Commençons par ce qui tient vraiment la route — et ce n’est pas l’argent.

Si tu fais tourner une IA sur tes propres serveurs, exclusivement pour tes propres besoins, alors, selon les autorités allemandes de protection des données, la relation de sous-traitance disparaît. Tu es seul responsable du traitement. Pas de contrat de sous-traitance au sens de l’art. 28 §3 du RGPD, pas de chaîne de sous-traitants, pas de transfert vers un pays tiers, pas de décision d’adéquation susceptible de tomber l’année prochaine.

C’est le point qu’il faut comprendre : le traitement local n’est pas une réduction du risque. C’est la disparition structurelle de toute une chaîne d’obligations. Les autorités de contrôle recommandent explicitement le traitement local, par exemple pour le post-entraînement et le fine-tuning.

Et la crainte répandue selon laquelle exploiter sa propre IA importerait des obligations réglementaires chez soi passe à côté de l’utilisateur privé : selon l’art. 2 §10, l’AI Act ne s’applique pas du tout à un usage purement personnel et non professionnel, et l’art. 2 §12 exempte de façon générale les systèmes open source gratuits.

(Ceci est une restitution de textes d’autorités et de textes légaux, en date du 24 juillet 2026 — ce n’est pas un conseil juridique. Pour un cas d’usage professionnel concret, adresse-toi à ta déléguée à la protection des données.)

Ce qui tient sur ta carte

L’information VRAM la plus honnête disponible officiellement, ce sont les tailles de fichiers dans la bibliothèque d’Ollama. En gros : il te faut à peu près autant de mémoire vidéo que la taille du fichier, plus un peu de marge.

ModèleTaille (Q4)Tient sur
Gemma 4, 12B7,6 Gocarte 8 Go, tout juste
gpt-oss-20bconçu pour 16 Gocarte 16 Go
Qwen3.6-27B17 Gocarte 24 Go
Gemma 4, 31B20 Gocarte 24 Go
Laguna XS 2.1 (q4)20 Gocarte 24 Go
Qwen3.6-35B24 Go24 Go, très juste

Le seuil d’entrée réaliste est donc une carte de 16 Go. Chez un grand revendeur allemand, une RTX 5060 Ti avec 16 Go était affichée à 555,85 € (prix promotionnel), la moins chère des cartes 16 Go classiques à 559,64 €. La carte 32 Go (RTX 5090) coûte un multiple de cela, à 4 248,99 €.

Deux choses à ce sujet sont rarement présentées correctement :

La quantification ne rend pas seulement les modèles plus petits, elle les rend plus rapides. Sur l’exemple standard Llama-3.1-8B, la variante 4 bits génère 71,93 tokens par seconde contre 29,17 pour la variante 16 bits — un facteur 2,5. La raison : la génération de texte est limitée par la bande passante mémoire. Moins de bits, c’est moins à lire. L’idée répandue selon laquelle la quantification ne serait qu’un compromis de qualité accepté uniquement faute de place n’est tout simplement pas exacte.

L’électricité n’a pas d’importance. À raison d’une heure de charge complète par jour, la 5060 Ti coûte environ 2,22 € par mois, la 5090 environ 7,09 € — calculé avec le tarif officiel allemand de l’électricité domestique de 40,55 centimes le kilowattheure. Même à quatre heures par jour, cela ne fait que 8,88 € et 28,35 €. L’argument selon lequel « l’IA locale ne serait pas rentable à cause du coût de l’électricité » est donc écarté. La décision se joue uniquement sur le prix d’achat.

Le calcul que presque personne n’écrit

Et le prix d’achat joue contre toi.

555,85 € correspondent — au taux de change à la date de consultation — à environ 253 millions de tokens de sortie sur Gemini 3.5 Flash-Lite. Sur Claude Haiku 4.5, ce sont 126 millions, sur Claude Sonnet 5 encore 63 millions, sur GPT-5.6 Sol tout de même 21 millions.

Prends la mesure de ce que ça signifie. Quelqu’un qui génère 5 000 tokens par jour — ce qui est déjà un usage quotidien intensif — mettrait environ 138 ans à épuiser 253 millions de tokens.

Exprimé en seuil de rentabilité : la carte d’entrée de gamme s’amortit après environ 71 mois, soit six ans, pour 10 € de dépenses API mensuelles. À 25 €, après un peu plus de deux ans. Ce n’est qu’à 50 € par mois que ça devient intéressant, en un peu moins de douze mois. La 5090, à 50 € par mois, met environ huit ans.

L’IA locale n’est presque jamais le choix financièrement le moins cher. Quiconque la justifie par « ça économise de l’argent sur la durée » se trompe, en général, dans son calcul. On l’achète pour la souveraineté des données — qui est une vraie valeur, mais une valeur différente.

Une exception honnête : qui a de toute façon besoin d’une résidence des données européenne pour des raisons de conformité paie chez les deux grands fournisseurs américains exactement 10 % de supplément — OpenAI parle de « a 10% uplift », Anthropic d’un facteur 1,1. Cela déplace légèrement le calcul, mais pas de façon spectaculaire.

L’écart de performance — et le piège dans le chiffre

Beaucoup de choses sont mélangées ici, et la distinction est décisive.

« Les modèles ouverts ont presque comblé leur retard » est vrai — dans l’Intelligence Index d’Artificial Analysis, Kimi K2.6 et MiMo V2.5 Pro sont à 54 points, DeepSeek V4 Pro à 52, contre 60 pour GPT-5.5 en tête. Un an plus tôt, l’écart était nettement plus grand.

« Je peux le faire tourner chez moi » est une affirmation différente à propos de modèles différents. Kimi K2.6 compte mille milliards de paramètres. DeepSeek V4 Pro, 1 600 milliards. Ce sont des modèles de datacenter. Ils sont ouverts — mais cela ne les rend pas exécutables sur ta carte graphique pour autant.

Ce qui tient réellement sur une seule carte se situe plus loin derrière : Qwen3.6-27B atteint 37 points d’index — rang 1 de sa catégorie de taille, mais 37 contre 60. gpt-oss-20b est à 15.

Et le contre-test en comparaison à l’aveugle est encore plus net : dans le classement LMArena, aucun modèle ouvert ne figure parmi les 15 premiers. Le meilleur modèle ouvert se situe au rang 29.

Par honnêteté, il faut préciser : la méthodologie de cette arène a été documentée et critiquée (« The Leaderboard Illusion »), notamment parce qu’une très grande part des données provient de quelques fournisseurs commerciaux. La critique vient toutefois d’auteurs eux-mêmes proches d’un fournisseur de modèles. Les deux éléments doivent être mis en regard.

Mon avis là-dessus : pour résumer, reformuler, structurer, coder simplement, un modèle 27B sur une carte 24 Go suffit largement. Pour les cas difficiles — raisonnement long, tâches imbriquées, travail agentique — tu sens immédiatement ces 23 points d’écart.

Où « local » n’est pas local

C’est la partie qu’aucun guide n’écrit, parce qu’elle est inconfortable.

L’invocation par défaut d’Ollama. Voir plus haut : depuis la v0.32.0, ollama démarre un agent sur un modèle cloud. Les modèles cloud figurent dans la même liste de bibliothèque que les modèles locaux, distingués seulement par le suffixe du tag — gemma4:31b tourne chez toi, gemma4:31b-cloud non. Un seul caractère de différence.

La recherche web de l’agent passe par les propres serveurs d’Ollama et exige un compte et une clé API.

Même un usage purement local génère des métadonnées. La politique de confidentialité d’Ollama fait la distinction proprement — le contenu n’est pas collecté localement, explicitement : « We do not collect, store, transmit, or have access to your prompts, responses, model interactions, or other content you process locally. » Les métadonnées d’appareil et d’usage, en revanche, le sont.

LM Studio se déclare exempt de télémétrie et nomme en même temps ouvertement les cinq fonctions qui ont besoin d’internet : recherche de modèles, téléchargement de modèles, statistiques du catalogue, téléchargements du runtime, vérification des mises à jour. C’est la version exemplaire — la limite est écrite dans la documentation.

Et pour l’un des modèles les plus connus, le premier pas vers la souveraineté est de céder son identité : pour télécharger les poids « ouverts » de Llama 4, Meta exige ton nom légal complet et ta date de naissance. La licence Llama n’est de toute façon pas une licence open source — quiconque dépasse 700 millions d’utilisateurs actifs mensuels doit demander la permission à Meta, accordée à sa seule discrétion.

Quel modèle choisir si la licence compte pour toi

Si « ouvert » doit vraiment signifier ouvert, la licence est le premier critère — et quelque chose a changé ici que presque tous les guides plus anciens présentent encore de façon erronée.

Gemma 4 est sous Apache 2.0 depuis sa sortie le 31 mars 2026 — la page de licence porte le texte complet et non modifié. Toutes les générations Gemma précédentes avaient une licence maison restrictive, dans laquelle Google se réservait même le droit de restreindre l’usage à distance. Cela s’applique toujours à Gemma 3 et aux versions antérieures. Si tu lis un guide qui dit « Gemma a sa propre licence », tu lis un guide dépassé.

Qwen3.6-27B est sous Apache 2.0 non modifiée, sans clause supplémentaire — et c’est en même temps le modèle le plus performant de sa catégorie de taille. Si je devais en recommander un pour une carte 24 Go, ce serait celui-là.

gpt-oss-20b est également sous Apache 2.0 et, selon sa fiche modèle, explicitement conçu pour 16 Go — le point d’entrée le plus confortable sur la carte d’entrée de gamme.

Ce que tu perds

Pour que ça ne devienne pas de la publicité, voici le prix honnête :

La vitesse. Une carte d’entrée de gamme n’est pas un datacenter. Avec des contextes longs et un raisonnement long, tu attends.

La capacité. 37 contre 60 points d’index, ce n’est pas une erreur d’arrondi. Ton modèle local gère moins bien les tâches difficiles.

La maintenance. Pilotes, quantifications, mises à jour de modèles, dépendances cassées. C’est un travail que personne ne te facture avec une API, parce que quelqu’un d’autre s’en charge.

Et un manque que je n’ai pas pu combler : je n’ai trouvé, dans la documentation officielle d’Ollama ni de LM Studio, aucune indication sur le fait que les poids de modèles téléchargés soient vérifiés cryptographiquement quant à leur provenance. Pour un fichier que tu exécutes sur ta propre machine, c’est une précision que j’aurais aimé avoir.

Mon avis

N’achète pas de carte graphique pour économiser de l’argent. Le calcul ne s’équilibre presque jamais, et quiconque te démontre le contraire a enjolivé soit ta consommation, soit le prix de la carte.

Achète-en une si ça compte pour toi que certains textes ne quittent jamais ta maison — dossiers de clients, dossiers de patients, manuscrits, contrats, tout ce où la question « où est-ce, là, maintenant ? » a besoin d’une vraie réponse. Pour cela, l’IA locale n’est pas la solution la moins chère, mais la seule solution propre, parce qu’alors plus aucun tiers ne figure dans la chaîne.

Et si tu débutes : commence petit. Une carte 16 Go, gpt-oss-20b ou un Gemma 4 de taille moyenne, et observe honnêtement pendant une semaine ce que tu utilises vraiment. Après ça, tu sauras si la carte 24 Go en vaut la peine — mieux que de le deviner à l’avance.

Les outils autour de tout ça se trouvent dans mon index de 137 outils d’IA, entretenu en continu ; lequel des modèles commerciaux est bon pour quoi se trouve dans la comparaison entre ChatGPT, Claude et Gemini.

Sources

Tout vérifié le 24 juillet 2026. Les prix, les états des modèles et les licences changent ; les prix du matériel sont des prix de revendeur à la date de consultation.

Si quelque chose ici te semble dépassé ou faux : écris-moi.