LLM Local 🤖
Guide étape par étape pour: Installer un chatbot, des LLM, des modèles de générations d'images et d'intégrer le LLM à VSCode, le tout en local.
Le guide IA en local
Prélude
De quoi va parler ce guide ?
- Du moteur de modèle LLM Ollama.
- De l’interface graphique pour Ollama (OpenWebUI).
- De Stable Diffusion (génération d’images IA en local).
- De l’intégration des modèles locaux à VS Code pour le développement assisté.
L’objectif : vous fournir un tutoriel complet, clair et pratique pour mettre en place une pile IA 100% locale, sécurisée, autonome et polyvalente.
Ce guide a été réécrit pour être plus pédagogique, mieux structuré et adapté à un usage professionnel ou technique.
🧠Pourquoi héberger un LLM local ?
🔒 1. Confidentialité
Aucune donnée ne quitte votre machine. Parfait pour :
- code source sensible
- documents internes
- environnements industriels
⚡ 2. Performances
Avec un GPU modeste (RTX, Quadro…), un modèle local peut répondre aussi vite qu’un modèle cloud.
💸 3. Pas de coût par token
Une fois installé, l’IA locale est gratuite à l’usage.
🧩 4. Liberté totale
Vous contrôlez : modèles, quantization, pipeline, extensions, intégration IDE…
🚀 Ollama + OpenWebUI
Installation rapide
docker run -d -p 3000:8080 \
--gpus=all \
-v ollama:/root/.ollama \
-v open-webui:/app/backend/data \
ghcr.io/open-webui/open-webui:ollama
Une fois lancé :
- Interface : http://localhost:3000
- Créez votre compte administrateur
- Installez un modèle :
docker exec -ti <ID_CONTAINER> bash -c "ollama run <nomDuModel>[:tag]"
Catalogue des modèles : https://ollama.com/search

Quels modèles choisir ?
💻 GPU 8–12 Go
- Phi-3 Mini
- Mistral 7B (Q4KM)
- LLaMA 3 8B (quantization légère)
💻 GPU 12–24 Go
- Qwen 7B / 14B
- LLaMA 3 8B en Q5
- Mistral-Nemo
🖥️ CPU only
- Phi-2
- TinyLLaMA
- Gemma 2B
Conseils
- Q4KM = excellent compromis vitesse/qualité
- Commencez petit, augmentez ensuite
🎨 Stable Diffusion – Génération d’images
Déploiement avec Docker Compose
services:
stable-diffusion-webui:
image: walkloly/sd-webui:latest
container_name: sd-webui
ports:
- "7860:7860"
volumes:
- sb_models:/app/stable-diffusion-webui/models
- sb_output:/app/stable-diffusion-webui/outputs
- sb_extensions:/app/stable-diffusion-webui/extensions
restart: unless-stopped
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities: [gpu]
ollama-webui:
image: ghcr.io/open-webui/open-webui:ollama
container_name: ollama-webui
ports:
- "3000:8080"
volumes:
- ollama:/root/.ollama
- open-webui:/app/backend/data
environment:
- ENABLE_IMAGE_GENERATION=True
volumes:
sb_models:
sb_output:
sb_extensions:
ollama:
external: true
open-webui:
external: true
- Stable Diffusion : http://localhost:7860
- Activez la génération d’images dans OpenWebUI (Paramètres → Images)

Lier Stable Diffusion Ă OpenWebUI
- Ouvrez http://localhost:3000
- Admin → Paramètres → Images
- Activez Génération d’images
- Choisissez Automatic1111
- URL interne SD :
http://stable-diffusion-webui:7860/
- Sélectionnez votre modèle

Génération via OpenWebUI :

Installer vos propres modèles SD
Téléchargez sur :
- Hugging Face
- CivitAI
- Automatic1111 GitHub
Placez les fichiers dans :
/app/stable-diffusion-webui/models/Stable-diffusion/
Copie Docker :
docker cp /chemin/modele.safetensors <ID_CONTAINER_SD>:/app/stable-diffusion-webui/models/Stable-diffusion/
🧩 Intégration à VS Code (Continue)
Utilisez vos modèles locaux directement dans VS Code : génération de code, explications, réécriture…
Installation
- Installer l’extension Continue
- Générer une API key dans OpenWebUI
- Ajouter :
{
"model": "ollama",
"api_key": "VOTRE_CLE_API"
}

Test de l’extension :

âś… Conclusion
Vous disposez désormais d’un environnement IA local complet :
- Ollama pour le texte
- OpenWebUI pour piloter les modèles
- Stable Diffusion pour les images
- VS Code pour l’assistance au développement
📌 EL OUAZIZI Walid – https://walidlab.dev