Comment configurer votre PC pour exécuter des modèles d’IA en local
Faire tourner un modèle d’IA sur votre propre ordinateur prend une vingtaine de minutes, dont l’essentiel est le téléchargement. Aucun compte, aucun abonnement, et une fois les poids sur votre disque tout fonctionne hors ligne : vos messages ne quittent jamais la machine.
Ce guide utilise Ollama, gratuit, open source et le moyen le plus simple de lancer un modèle. Il télécharge les poids, utilise votre carte graphique quand il le peut et sert le modèle : toute l’installation tient en un installeur et une commande.
Cette page est une traduction. L’original est en anglais.
Étape 1 — Vérifiez ce que votre PC peut exécuter
La taille du modèle est limitée par la mémoire avant tout le reste. Un modèle qui tient dans la VRAM de votre carte graphique est rapide ; s’il n’y tient pas, il doit être partagé avec la mémoire vive, ce qui fonctionne mais reste nettement plus lent ; et s’il ne tient dans aucune des deux, il ne se charge pas du tout.
Le découvrir en téléchargeant 20 Go de poids est le chemin le plus long — vérifiez avant.
Étape 2 — Installez Ollama
Téléchargez l’installeur correspondant à votre système et lancez-le. Sous Windows, il installe un service en arrière-plan et ajoute la commande ollama ; rien d’autre à configurer ensuite.
Télécharger Ollama depuis ollama.comWindows, macOS et Linux. Prenez l’habitude de ne télécharger que depuis ollama.com : les copies d’outils d’IA populaires sont un moyen courant de distribuer autre chose.
Étape 3 — Téléchargez et lancez votre premier modèle
Ouvrez un terminal — Invite de commandes ou PowerShell sous Windows, Terminal sous macOS ou Linux — et exécutez une seule commande. La première fois, elle télécharge le modèle et ouvre une conversation avec lui :
ollama run gemma3Environ 3 Go. Le téléchargement n’a lieu qu’une fois ; ensuite le modèle démarre en quelques secondes.
Une invite apparaît à la fin. Tapez une question, appuyez sur Entrée, et la réponse est générée sur votre propre matériel. Tapez /bye pour quitter la conversation.
Commencez petit même si votre PC peut faire mieux : un modèle de 3B ou 4B confirme en quelques minutes que tout fonctionne, et vous pourrez monter ensuite. Remplacez le nom par n’importe quel modèle du catalogue, qui indique ce que chacun exige.
Étape 4 — Les commandes à connaître
Ces cinq-là couvrent presque tout au quotidien :
ollama pull qwen3:8bTélécharger un modèle sans ouvrir de conversation.
ollama listLister les modèles déjà présents sur le disque, avec leur taille.
ollama rm qwen3:8bSupprimer un modèle et récupérer l’espace disque.
ollama show gemma3Afficher ce dont un modèle a besoin et comment il est configuré.
ollama psAfficher les modèles actuellement chargés en mémoire.
Un nom comme qwen3:8b désigne le modèle suivi de la variante. La partie après les deux-points choisit la taille et la quantification ; sans elle, vous obtenez la variante par défaut, généralement une version 4 bits de taille moyenne. Chaque page de modèle de ce site liste les variantes disponibles et la mémoire que chacune réclame.
Où sont stockés les modèles
Les poids pèsent plusieurs gigaoctets chacun et vont sur votre disque système par défaut :
| Système | Emplacement |
|---|---|
| Windows | %USERPROFILE%\.ollama\models |
| macOS | ~/.ollama/models |
| Linux | /usr/share/ollama/.ollama/models |
Si votre disque système est à l’étroit, définissez la variable d’environnement OLLAMA_MODELS vers un dossier sur un autre disque et redémarrez Ollama. Les modèles déjà téléchargés restent où ils sont tant que vous ne les déplacez pas vous-même.
L’utiliser depuis vos propres applications
Tant qu’il tourne, Ollama expose une API locale sur le port 11434. C’est à elle que se connectent les interfaces de conversation de bureau et les extensions d’éditeur, et c’est ainsi que vous appelleriez un modèle depuis votre propre code : rien ne quitte votre machine.
curl http://localhost:11434/api/generate -d "{\"model\":\"gemma3\",\"prompt\":\"Why is the sky blue?\"}"Une simple requête HTTP vers le modèle qui tourne sur votre PC.
Si c’est lent
- Vérifiez qu’il utilise bien la carte graphique. Lancez ollama ps pendant qu’un modèle est chargé : la commande indique la part placée sur le GPU. Un modèle entièrement sur le processeur est la cause habituelle des réponses lentes.
- Prenez une variante plus petite. Un modèle qui ne tient pas en VRAM est partagé avec la mémoire vive, et la partie déportée tourne à une fraction de la vitesse. Descendre d’une taille est souvent bien plus rapide.
- Raccourcissez le contexte. Le cache KV grandit avec la fenêtre de contexte et se dispute la même mémoire que les poids : un contexte long peut faire sortir de la VRAM un modèle qui y tiendrait autrement.
- Mettez à jour vos pilotes graphiques. L’accélération en dépend, et un pilote ancien peut signifier que la carte graphique n’est pas utilisée du tout.
Questions fréquentes
- Faut-il une carte graphique pour exécuter des modèles d’IA en local ?
- Non, mais elle change ce qui est praticable. Ollama fonctionne avec le seul processeur et la mémoire vive, ce qui suffit pour de petits modèles et devient lent sur les grands. Une carte graphique dédiée garde le modèle en VRAM et se révèle en général bien plus rapide : la quantité de VRAM détermine donc quels modèles sont confortables, pas seulement lesquels sont possibles.
- De combien de RAM et de VRAM ai-je besoin ?
- En règle générale, un modèle quantifié en 4 bits demande environ 0,6 Go par milliard de paramètres, plus la mémoire de la fenêtre de contexte et la surcharge du moteur. Un modèle de 8B réclame donc près de 6 Go de VRAM avec un contexte court. Ce n’est qu’un ordre de grandeur : l’analyse proposée ici le calcule à partir de votre matériel réel et de la variante exacte que vous visez.
- Ollama est-il gratuit, et fonctionne-t-il hors ligne ?
- Ollama est gratuit et open source, et aucun compte n’est nécessaire. Télécharger un modèle demande une connexion, mais une fois les poids sur le disque le modèle tourne entièrement sur votre machine, hors ligne, et vos messages ne sont envoyés nulle part.
- Où Ollama stocke-t-il les modèles ?
- Sous Windows les poids vont dans %USERPROFILE%\.ollama\models, sous macOS dans ~/.ollama/models et sous Linux dans /usr/share/ollama/.ollama/models. Chaque modèle pèse plusieurs gigaoctets : si votre disque système est juste, vous pouvez pointer Ollama ailleurs avec la variable d’environnement OLLAMA_MODELS.
- Par quel modèle commencer ?
- Par un petit : une variante 3B ou 4B se télécharge en quelques minutes, tourne sur du matériel modeste et suffit à confirmer que tout fonctionne. Une fois l’installation validée, passez au plus grand modèle que votre matériel supporte confortablement.
- Peut-on utiliser Ollama sans la ligne de commande ?
- Oui. Ollama expose une API locale sur le port 11434, et plusieurs interfaces de bureau ou de navigateur s’y connectent pour vous offrir une fenêtre de conversation. La ligne de commande n’est que le moyen le plus rapide de lancer le premier modèle.
Vous ne savez pas quel modèle installer ?
Analysez votre PC et obtenez la liste de tous les modèles qu’il peut exécuter, avec la mémoire nécessaire à chacun et pourquoi. Cela prend une minute et ne demande aucun compte.