guide · 4 min read
Installer Ollama sur son serveur
Le conteneur, la carte graphique passée à Docker, et la commande la plus copiée d'Internet — celle qui ouvre votre modèle sur tout le réseau.
Ollama est la façon la plus courte de faire tourner un modèle chez soi : une commande pour l'installer, une pour télécharger un modèle, et il expose une API que le reste de vos outils sait appeler.
Ce guide part d'un Ubuntu Server avec Docker dessus — voir Installer Ubuntu Server et Installer Docker si ce n'est pas encore fait. Comptez vingt minutes, dont quinze d'attente pendant un téléchargement.
Avant de commencer : est-ce que ça tient dans votre carte ?
C'est la question qui décide, et elle se répond avant d'installer quoi que ce soit. Un modèle qui ne tient pas dans la mémoire de votre carte déborde en mémoire système, et la vitesse s'effondre — vous ne l'apprendrez pas d'un message d'erreur, mais d'une réponse qui met deux minutes à arriver.
Ce que votre matériel sait faire tourner donne le chiffre pour votre carte, et ce qu'un modèle réclame pour le sens inverse.
Sans carte graphique
Ça fonctionne, sur les petits modèles, et c'est lent. Autant le savoir plutôt que de découvrir la lenteur après l'installation.
docker run -d -v ollama:/root/.ollama -p 127.0.0.1:11434:11434 \
--name ollama ollama/ollama
Notez le 127.0.0.1: devant le port. La commande que vous trouverez partout
écrit -p 11434:11434, qui ouvre le service sur tout votre réseau. On y
revient plus bas, parce que c'est le vrai piège de ce guide.
Avec une carte NVIDIA
Docker ne voit pas votre carte par défaut. Il faut lui donner le NVIDIA Container Toolkit, en cinq étapes — c'est là que tout le monde se bloque.
NVIDIA=https://nvidia.github.io/libnvidia-container
CLE=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -fsSL $NVIDIA/gpgkey | sudo gpg --dearmor -o $CLE
curl -s -L $NVIDIA/stable/deb/nvidia-container-toolkit.list \
| sed "s#deb https://#deb [signed-by=$CLE] https://#g" \
| sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt-get update
sudo apt-get install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
La ligne sed a l'air d'un détail de copier-coller. Elle réécrit le dépôt
pour le rattacher à la clé qu'on vient de poser, et sans elle apt update
refuse le dépôt comme non signé. C'est l'étape que la moitié des tutoriels
oublient.
Puis le conteneur, avec la carte :
docker run -d --gpus=all -v ollama:/root/.ollama -p 127.0.0.1:11434:11434 \
--name ollama ollama/ollama
Vérifiez qu'il la voit vraiment :
docker exec ollama nvidia-smi
Si la carte n'apparaît pas, le conteneur tourne quand même — sur le processeur, lentement, sans rien dire. C'est la panne silencieuse de ce guide, et cette commande est le seul moyen de la voir.
Le vrai piège : Ollama n'a aucun mot de passe
Il n'y a ni compte, ni jeton, ni la moindre authentification. Qui atteint le port 11434 pilote la machine : il peut télécharger des modèles, en supprimer, et consommer votre carte à votre place.
C'est pour ça que les commandes de ce guide écrivent -p 127.0.0.1:11434:11434
et non -p 11434:11434. La première n'écoute que sur la machine elle-même ;
la seconde ouvre le service à tout votre réseau local — et si votre routeur
redirige ce port, à tout Internet.
Pour y accéder depuis un autre appareil, deux chemins, et aucun des deux n'est « ouvrir le port » :
- Tailscale relie vos appareils entre eux sans rien exposer ;
- un reverse proxy avec authentification, si vous voulez y accéder depuis un navigateur.
Télécharger un modèle et lui parler
docker exec -it ollama ollama pull qwen3.5:9b
docker exec -it ollama ollama run qwen3.5:9b
Le premier téléchargement pèse plusieurs gigaoctets. Le second démarrage est
immédiat : le modèle reste dans le volume ollama.
Pour vérifier que l'API répond, ce qui est ce dont vos autres outils auront besoin :
curl http://127.0.0.1:11434/api/tags
Ce que ce guide ne vous dira pas
Combien de jetons par seconde vous obtiendrez. Ça dépend de la bande passante mémoire de votre carte, du moteur, de la longueur du contexte et de celle des réponses — c'est un banc d'essai, pas une donnée, et personne ne peut vous le promettre pour votre configuration exacte.
Ce qu'on peut vous dire, en revanche, c'est ce qui rentre et ce que ça consomme. C'est calculé, page par matériel, sur le volet modèles.
Video
Hey Initium lance Ollama dans Docker et l'interroge par son API — la partie où l'on voit ce que les commandes produisent vraiment.
Nothing is sent to YouTube until you press play. This site sets no cookies of its own.Watch on YouTube