In this article
Comment exécuter des modèles LLM en local avec Docker
Quand les développeurs découvrent les grands modèles de langage (LLM), c’est souvent dans le contexte de modèles fondamentaux comme GPT-4o d’OpenAI, Gemini 2.5 Pro de Google et Claude Sonnet 4 d’Anthropic. Pourtant, certains cas d’usage de l’IA générative peuvent être entièrement traités en local, sur votre machine de développement.
Dans ce guide de démarrage rapide, je vais vous expliquer comment configurer rapidement des modèles pour les exécuter en local sur votre ordinateur portable (ou effectuer l’inférence si vous disposez des GPU nécessaires), sans vous attarder sur le jargon du machine learning, les outils Python ou d’autres compétences qui peuvent sembler hors de portée pour un développeur logiciel.
Pourquoi exécuter des modèles LLM en local sur votre propre machine ?
Que ce soit pour des raisons de coût, de confidentialité et de sécurité, de politique d’entreprise ou de réglementation externe, certains cas d’usage et certaines exigences nécessitent d’exécuter des modèles en local, dans votre propre environnement (un centre de données sur site) ou directement sur votre PC ou ordinateur portable.
Comment exécuter des modèles avec Docker
Docker s’est fait connaître comme une technologie qui abstrait de nombreux obstacles liés à la conteneurisation des applications et leur permet de s’exécuter sans difficulté sur différentes plateformes. Docker fait désormais de même avec les LLM.
Pour suivre ce tutoriel, vous aurez besoin de :
Docker Engine ou Docker Desktop, version 4.41 ou ultérieure. Il est donc recommandé de mettre à jour votre installation locale pour suivre ce tutoriel sans problème.
Pour en savoir plus, consultez la documentation de Docker Model Runner.
Étape 1 : activer Docker Model Runner
Si vous avez installé la dernière version de Docker, cette fonctionnalité est probablement déjà activée. Vous devrez toutefois activer la host-side TCP support pour pouvoir vous connecter au modèle depuis du code, par exemple avec le SDK AI de Vercel. Sinon, vous pourrez interagir avec le moteur d’exécution des modèles uniquement via la CLI docker.
Ouvrez les paramètres de Docker Desktop, accédez aux fonctionnalités bêta, puis activez les deux options suivantes :
« Activer Docker Model Runner »
« Activer la prise en charge TCP côté hôte »

Étape 2 : obtenir un modèle LLM
Ouvrez ensuite le tableau de bord Docker Desktop et sélectionnez Modèles dans le menu de la barre latérale gauche pour afficher tous les modèles disponibles :

Vous pouvez également trouver des modèles en ligne sur Docker Hub.
Nous allons choisir le modèle smollm2, qui occupe moins de 300 mégaoctets d’espace disque. Pour des modèles plus performants, je recommande toutefois la gamme de 3B à 4B, comme gemma3, ou l’échelon supérieur avec des modèles de 7B à 8B paramètres. Vous pouvez aussi essayer phi4 de Microsoft, qui compte 14B paramètres.
Notez que les performances du modèle dépendent fortement de votre CPU et de votre GPU, ainsi que du moteur d’inférence disponible localement pour exploiter ces ressources. Docker facilite les tests en local, mais la configuration par défaut n’est probablement pas optimisée pour offrir les meilleures performances.
Maintenant que nous avons choisi le modèle à exécuter en local, il suffit de lancer cette commande dans le terminal :
docker model run ai/smollm2Comme le modèle n’est probablement pas installé dans votre environnement, Docker le récupérera depuis le registre, puis le lancera :

Vous pouvez maintenant interagir avec le modèle dans une session interactive depuis la CLI.
Étape 3 : utiliser le LLM local avec un SDK AI
Le SDK AI de Vercel est généralement utilisé avec des points de terminaison de modèles hébergés, comme ceux d’OpenAI ou d’Anthropic. Il est toutefois facile de l’adapter à un modèle auto-hébergé, tel que celui exécuté avec Docker Model Runner.
En général, l’utilisation d’un LLM implique de créer un récupérateur personnalisé à l’aide des primitives createStreamableUI() et streamText() du SDK. Voici un exemple de code TypeScript qui montre comment le configurer comme s’il s’agissait d’un point de terminaison OpenAI.
Commencez par vérifier que le SDK AI est installé :
npm install aiConfigurez les variables d’environnement :
OPENAI_API_KEY=docker
OPENAI_BASE_URL=http://localhost:12434/engines/llama.cpp/v1Notez que OPENAI_API_KEY est bien définie sur docker : il ne s’agit pas d’une valeur générique à remplacer.
Vous pouvez ensuite définir une route API comme suit :
import { OpenAIStream, StreamingTextResponse } from 'ai';
import OpenAI from 'openai';
// or 'nodejs' depending on your environment
export const runtime = 'edge';
const openai = new OpenAI({
apiKey: process.env.OPENAI_API_KEY!,
baseURL: process.env.OPENAI_BASE_URL!,
});
export async function POST(req: Request) {
const { messages } = await req.json();
const response = await openai.chat.completions.create({
model: 'ai/smollm2',
messages,
stream: true,
});
const stream = OpenAIStream(response);
return new StreamingTextResponse(stream);
}
De même, vous pouvez utiliser le SDK officiel d’OpenAI et le configurer avec les valeurs de votre propre Docker Model Runner local pour OPENAI_BASE_URL et OPENAI_API_KEY.
En savoir plus sur Docker, l’IA et la sécurité
Maintenant que votre LLM s’exécute en local, vous pouvez prendre des mesures pour vous assurer qu’il génère du code sécurisé, vous informer sur les attaques par injection de prompt et éventuellement explorer l’univers MCP.
Pour en savoir plus sur ces sujets, je vous recommande les articles suivants :
Puisque Docker est déjà installé pour ce tutoriel sur les LLM locaux, vous pouvez également découvrir comment exécuter des serveurs MCP avec Docker.
Découvrez comment exploiter l’injection de prompt à l’aide de texte invisible dans un PDF pour tromper une logique basée sur un LLM.
Si vous découvrez MCP, consultez ce guide pour comprendre visuellement l’architecture MCP.
Pour en savoir plus sur MCP, consultez cette sélection de serveurs MCP populaires pour les développeurs.
Commencez à sécuriser le code généré par l’IA
Créez gratuitement votre compte Snyk pour commencer à sécuriser le code généré par l’IA en quelques minutes. Vous pouvez aussi réserver une démonstration avec un expert pour découvrir comment Snyk répond à vos besoins en sécurité des développeurs.