Aller au contenu
La Brèche
Intelligence artificielle · Guide

IA en local : faire tourner un modèle chez soi

Faire tourner une IA chez soi avec Ollama ou LM Studio : matériel nécessaire, modèles à choisir, avantages pour la confidentialité et limites réelles.

L'essentiel
  • Une IA locale tourne sur votre ordinateur, sans rien envoyer sur Internet
  • La mémoire est le facteur clé : elle détermine la taille du modèle utilisable
  • LM Studio pour débuter en interface graphique, Ollama pour l'intégrer à vos outils
  • Très bon pour les tâches courantes, en retrait sur les tâches complexes

Faire tourner une IA directement sur son ordinateur, sans abonnement et sans envoyer la moindre donnée sur Internet : c'est possible depuis que des modèles de langage performants sont publiés en « poids ouverts » par Meta, Mistral AI, Google, Alibaba et d'autres. Des outils comme Ollama et LM Studio rendent l'installation accessible en quelques minutes. Reste à savoir ce que votre machine peut faire tourner, et ce qu'il faut en attendre.

Pourquoi faire tourner une IA en local

  • La confidentialité : rien ne quitte votre ordinateur. Vous pouvez traiter des documents sensibles, des données clients ou personnelles sans les confier à un tiers.
  • La gratuité : pas d'abonnement ni de facturation à l'usage, seulement l'électricité.
  • Le fonctionnement hors ligne : dans le train, en avion, ou sur un réseau restreint.
  • La liberté : choisir son modèle, le régler, l'intégrer à ses propres outils.
  • L'apprentissage : comprendre concrètement comment fonctionnent ces modèles.

Ce qu'il faut savoir sur le matériel

Le facteur décisif est la mémoire disponible pour le modèle : la mémoire vidéo (VRAM) d'une carte graphique, ou la mémoire unifiée d'un Mac à puce Apple. Elle détermine la taille du modèle que vous pouvez charger.

Les modèles sont décrits par leur nombre de paramètres (en milliards, noté « B »). Grâce à la quantification, une technique qui compresse le modèle avec une perte de qualité limitée, les besoins baissent nettement. Ordres de grandeur indicatifs avec une quantification courante :

Taille du modèle Mémoire à prévoir Ce qu'on peut en attendre
1 à 4 milliards de paramètres 4 Go environ Tâches simples, résumés courts, tri
7 à 9 milliards 8 Go environ Bon assistant du quotidien
12 à 14 milliards 12 à 16 Go Nettement meilleur en rédaction et raisonnement
30 milliards et plus 24 Go et plus Proche des services en ligne sur beaucoup de tâches

Sans carte graphique, les petits modèles tournent sur le processeur, plus lentement mais de façon utilisable. Les Mac à puce Apple sont particulièrement efficaces, car toute leur mémoire peut servir au modèle.

LM Studio : le plus simple pour débuter

LM Studio est une application de bureau (Windows, macOS, Linux) avec une interface graphique complète : vous cherchez un modèle, l'application indique s'il tient dans votre mémoire, vous le téléchargez et discutez avec lui comme avec ChatGPT. Elle est gratuite, y compris pour un usage professionnel.

Pour qui : découvrir l'IA locale sans ligne de commande.

Ollama : le plus pratique pour l'intégrer à vos outils

Ollama est un outil libre qui télécharge et fait tourner les modèles en une commande :

ollama run mistral

Surtout, il expose une API locale que d'autres logiciels peuvent utiliser : éditeurs de code, interfaces de chat comme Open WebUI, ou outils d'automatisation comme n8n. Vous pouvez ainsi construire des workflows d'IA entièrement privés (voir n8n Cloud ou auto-hébergé : que choisir ?).

Pour qui : les profils techniques, et tous ceux qui veulent brancher l'IA locale sur d'autres outils.

Quel modèle choisir

Les familles de modèles ouverts évoluent très vite. Plutôt qu'une liste qui serait périmée dans trois mois, voici comment choisir :

  1. Partez de votre mémoire : choisissez la plus grande taille qui tient confortablement (voir le tableau).
  2. Privilégiez les familles reconnues : Mistral, Llama (Meta), Gemma (Google), Qwen (Alibaba) publient des modèles régulièrement mis à jour.
  3. Vérifiez le français : certains modèles sont nettement meilleurs que d'autres dans notre langue.
  4. Testez sur vos tâches : les catalogues d'Ollama et de LM Studio permettent d'essayer plusieurs modèles en quelques minutes.

Les limites à connaître

  • La qualité : un modèle local de taille moyenne reste en retrait des grands services en ligne sur le raisonnement complexe et les connaissances pointues.
  • La vitesse : sans carte graphique puissante, les réponses s'affichent plus lentement.
  • Les fonctions : pas de recherche web ni de génération d'images intégrées par défaut, il faut les ajouter avec d'autres outils.
  • Les licences : chaque modèle a sa licence, plus ou moins permissive pour l'usage commercial. Vérifiez-la avant un usage professionnel.

Par où commencer

  1. Installez LM Studio et téléchargez un modèle de 7 à 9 milliards de paramètres.
  2. Testez-le sur vos usages réels : résumer un document, reformuler un e-mail.
  3. Si vous voulez aller plus loin, installez Ollama et branchez-le à vos outils.

Pour comparer avec les assistants en ligne gratuits, voir Meilleure IA gratuite : laquelle choisir ?. Et pour comprendre ce qui se passe sous le capot, lisez IA générative : définition, usages et limites.

Questions fréquentes

Une IA locale est-elle aussi bonne que ChatGPT ?

Non, pas avec un ordinateur personnel. Les petits modèles qui tiennent sur une machine grand public sont très bons pour les tâches courantes (résumé, reformulation, tri), mais en retrait sur le raisonnement complexe par rapport aux modèles des grands services en ligne.

Faut-il une carte graphique ?

Ce n'est pas obligatoire, mais c'est ce qui fait la différence de vitesse. Sans carte graphique dédiée, les petits modèles tournent sur le processeur, plus lentement. Les Mac à puce Apple sont efficaces grâce à leur mémoire unifiée.

Une IA locale fonctionne-t-elle sans Internet ?

Oui. Une fois le modèle téléchargé, tout se passe sur votre machine, sans connexion. C'est l'un de ses principaux intérêts.