L’intelligence artificielle ne vit plus uniquement dans le cloud. Aujourd’hui, il est possible de construire une station de travail capable d’exécuter des modèles de langage avancés en local avec un budget inférieur à 2 000 €. Et pour de nombreux usages, cette approche devient plus pertinente qu’on ne l’imagine.

Jusqu’à récemment, parler d’intelligence artificielle signifiait parler du cloud.
Chaque requête passait par une API. Chaque document était traité sur une infrastructure externe. Chaque nouveau projet impliquait un coût directement lié à l’utilisation.
C’était le modèle naturel et, pour de nombreux scénarios, cela reste encore le meilleur choix.
Mais ces derniers mois, j’ai l’impression que la question est en train de changer.
Il ne s’agit plus seulement de savoir quel modèle choisir ou quelle API est la moins chère.
Une autre question apparaît de plus en plus :
Est-il encore pertinent de dépendre entièrement du cloud ?
À mon avis, la réponse est non.
Pas parce que le cloud perd de son importance. Les modèles les plus avancés continueront à nécessiter des infrastructures considérables et les services cloud resteront essentiels.
Mais un nombre croissant de tâches peuvent désormais être exécutées directement sur sa propre machine, en gardant les documents, le code et les données sensibles sous son contrôle.
C’est probablement l’un des changements les plus intéressants que connaît aujourd’hui l’intelligence artificielle.
Pourquoi maintenant ?
Trois facteurs accélèrent cette évolution.
Le premier concerne les modèles eux-mêmes.
Des familles comme Llama, Qwen, Mistral, Gemma et DeepSeek ont démontré que les modèles open weight sont désormais suffisamment performants pour des usages réels : développement logiciel, analyse documentaire, systèmes RAG, assistants personnels et automatisation de processus.
Le deuxième facteur est logiciel.
Des outils comme Ollama, LM Studio et llama.cpp ont considérablement réduit la complexité nécessaire pour exécuter un modèle en local. Ce qui demandait auparavant des compétences avancées peut aujourd’hui être configuré en quelques minutes.
Le troisième facteur est le matériel.
Le marché de l’occasion a rendu plus accessibles des cartes graphiques haut de gamme qui étaient encore très coûteuses il y a peu. Le rapport entre prix et performances a ainsi fortement évolué.
La ressource la plus importante n’est pas le processeur
Lorsque l’on construit un ordinateur, on commence souvent par regarder le processeur.
Pour les modèles de langage, le composant déterminant est pourtant souvent différent : la mémoire vidéo du GPU.
Chaque modèle doit être chargé en VRAM avant de pouvoir fonctionner. S’il ne tient pas entièrement dans cette mémoire, une partie du traitement est déplacée vers la mémoire principale du système, ce qui réduit fortement les performances.
C’est pourquoi une carte graphique disposant de 24 Go de VRAM représente aujourd’hui un excellent compromis.
Grâce à la quantification, il est possible d’exécuter des modèles beaucoup plus grands que leur taille initiale.
À titre indicatif :
- les modèles 7B-8B fonctionnent sans difficulté ;
- les modèles 14B-22B représentent actuellement une gamme très intéressante pour un usage professionnel ;
- les modèles 70B nécessitent des configurations plus avancées, souvent avec plusieurs GPU.
La taille du modèle n’est cependant pas le seul critère.
Un modèle plus petit et spécialisé peut être plus efficace qu’un modèle beaucoup plus grand pour une tâche précise.
Ordinateur fixe ou portable ?
Pour exécuter des modèles d’IA en local, l’ordinateur fixe reste aujourd’hui le choix le plus rationnel.
La raison est simple : la VRAM.
De nombreux GPU pour ordinateurs portables disposent de moins de mémoire que leurs équivalents de bureau. Par exemple, une RTX 4090 portable propose généralement 16 Go de VRAM, alors que la version desktop dispose de 24 Go.
Cette différence limite directement la taille des modèles exécutables.
Un ordinateur fixe offre également un meilleur refroidissement, davantage de possibilités d’évolution et un marché de l’occasion plus intéressant.
La contrepartie concerne l’encombrement et la consommation énergétique.
Trois configurations IA sous les 2 000 €
RTX 3090 : le meilleur équilibre
Si je devais recommander une seule configuration aujourd’hui, ce serait probablement celle-ci.
Une RTX 3090 avec 24 Go de VRAM offre encore l’un des meilleurs rapports prix-performance disponibles.
Avec un budget compris entre 1 400 et 1 700 €, il est possible de construire une machine équipée de :
- Nvidia RTX 3090 (24 Go) ;
- AMD Ryzen 9 ou Intel Core i7 ;
- 64 Go de mémoire vive ;
- SSD NVMe de 2 To.
C’est une configuration adaptée aux développeurs, consultants et professionnels qui souhaitent utiliser régulièrement des modèles locaux.
Station de travail professionnelle reconditionnée
Pour ceux qui préfèrent éviter l’assemblage d’un PC, les stations de travail professionnelles reconditionnées constituent une alternative intéressante.
Des machines comme Dell Precision, HP Z ou Lenovo ThinkStation sont conçues pour fonctionner pendant de longues périodes et offrent une bonne fiabilité.
Avec une RTX A5000 de 24 Go, 64 à 128 Go de mémoire vive et un stockage rapide, il est possible de rester dans un budget proche de 2 000 €.
C’est une solution particulièrement adaptée aux petites équipes techniques ou aux environnements professionnels.
Deux RTX 3090
Pour ceux qui souhaitent expérimenter avec des modèles plus importants, une configuration équipée de deux RTX 3090 permet d’atteindre 48 Go de VRAM au total.
Cela ouvre la possibilité d’exécuter des modèles quantifiés plus volumineux.
La contrepartie est une complexité accrue : consommation électrique plus élevée, davantage de chaleur, alimentation adaptée et configuration logicielle plus exigeante.
C’est une solution puissante, mais pas celle que je recommanderais pour commencer.
Acheter du matériel d’occasion
Le marché de l’occasion peut réduire fortement les coûts, mais il demande quelques précautions.
De nombreux GPU proviennent de machines utilisées pour le minage de cryptomonnaies.
Cela ne signifie pas forcément qu’ils sont en mauvais état, mais il est préférable de vérifier les températures en charge, l’état des ventilateurs et les conditions générales de la carte.
Lorsque c’est possible, acheter auprès d’un vendeur professionnel avec une garantie apporte une sécurité supplémentaire.
La confidentialité n’est pas le seul avantage
Lorsque l’on parle d’IA locale, le premier argument évoqué est souvent la confidentialité.
C’est un point important.
Mais je pense que l’avantage le plus intéressant se trouve ailleurs.
Les agents IA changent progressivement notre manière d’utiliser les modèles de langage.
Ils ne réalisent pas une simple requête.
Ils analysent un problème, lisent des documents, écrivent du code, vérifient leurs résultats, corrigent leurs erreurs et recommencent.
Lorsque chaque étape passe par une API payante, les coûts peuvent rapidement augmenter.
Exécuter une partie de ces charges localement change l’équilibre économique.
Cela ne remplace pas le cloud.
Cela permet simplement de l’utiliser là où il apporte une réelle valeur et de garder le reste sous son contrôle.
Conclusion
Pendant des années, le cloud a été la seule option réellement accessible.
Aujourd’hui, ce n’est plus totalement vrai.
Avec moins de 2 000 €, il est possible de construire une station de travail capable d’exécuter des modèles de langage avancés en local et de répondre à de nombreux besoins quotidiens en intelligence artificielle sans dépendre entièrement de services externes.
Ce ne sera pas la bonne solution pour tout le monde.
Mais j’ai le sentiment que nous assistons au début d’un changement comparable à celui des ordinateurs personnels.
Au départ, ils étaient réservés aux passionnés.
Puis ils sont devenus un outil que chacun considérait comme normal.
Peut-être qu’un jour, disposer de son propre modèle d’intelligence artificielle sur sa machine nous semblera tout aussi naturel.