Brouillon en relecture. Ce contenu n’a pas encore été validé par l’auteur.

Dimensionner et sécuriser une IA locale

  • 7 min
  • 30 points
  1. 1Pourquoi, et quand, garder l’IA chez soi
  2. 2Six architectures, un arbre de décision
  3. 3Dimensionner et sécuriser une IA locale

À la fin de cette étape, vous saurez :

  • Estimer la mémoire nécessaire pour faire tourner un modèle chez soi
  • Connaître les règles de sécurité de base d’une installation locale

Situation

Hélène a choisi une architecture hybride : les pièces des clients resteront au cabinet. Reste à savoir quel ordinateur acheter, et comment éviter que cette IA devienne une porte d’entrée pour un attaquant.

L’essentiel

La mémoire nécessaire dépend surtout de la taille du modèle, comptée en milliards de paramètres. Règle empirique relevée mi-2026 dans des comparatifs tiers : environ 0,6 Go par milliard de paramètres en Quantification Compression d'un modèle pour réduire son empreinte mémoire. Voir le glossaire 4 bits, plus 20 à 30 % de marge. C’est un ordre de grandeur, à vérifier sur votre matériel.

Simulation

Dimensionner une IA locale

Choisissez la taille d’un modèle à faire tourner chez vous. Essayez au moins trois tailles qui demandent un matériel différent.

Mémoire nécessaire : 5,0 à 5,5 Go

Dont 4,2 Go pour les poids du modèle (quantification 4 bits), plus 20 à 30 % de marge pour le contexte.

Matériel typique : Portable récent avec 16 Go de RAM

  1. Portable récent avec 16 Go de RAM
  2. GPU de 12 à 16 Go, ou Mac à mémoire unifiée suffisante
  3. GPU de 24 Go, ou Mac avec 32 Go et plus
  4. Serveur ou station dédiée

Ordre de grandeur relevé mi-2026 dans des comparatifs tiers (sources secondaires) : à vérifier sur votre propre matériel. La vitesse de réponse n’est pas estimée ici.

Une IA locale se sécurise comme un serveur

  • Ne l’exposez pas sur Internet sans authentification ; isolez les services (conteneurs, réseau).
  • Téléchargez les modèles depuis des sources fiables, et préférez les formats qui n’exécutent pas de code au chargement, comme safetensors.
  • Mettez à jour, journalisez, sauvegardez.
  • Contrôlez l’accès aux documents indexés : un assistant qui interroge vos documents, mal cloisonné, expose tout.
ComprendreLes briques d’une installation locale

Un moteur d’Inférence Exécution d'un modèle pour produire une réponse. Voir le glossaire fait tourner le modèle (Ollama, LM Studio, llama.cpp, vLLM pour un serveur…). Une interface permet de discuter avec lui (Open WebUI, AnythingLLM). Les modèles à poids ouverts changent chaque mois : choisissez-les au moment d’installer, et relisez leur licence. Chaque brique a la sienne, comme on l’a vu dans le module « Choisir ses outils et lire les licences ».

À retenir

  • Environ 0,6 Go par milliard de paramètres en 4 bits, plus 20 à 30 % : un ordre de grandeur, pas une mesure.
  • Commencez par un petit modèle, mesurez sur vos tâches, agrandissez si la qualité ne suffit pas.
  • Une IA locale se sécurise comme un serveur : authentification, isolement, mises à jour, sauvegardes.

Sources

Contenu tiré de la base de connaissance du site (§4.3, §4.4, §4.7), dont chaque affirmation est sourcée et datée. Dernière vérification des sources : 24 septembre 2026. À revérifier avant le 24 mars 2027.

Fin de l’étape

Faites les activités de la page, puis terminez l’étape.