Skip to content
selfhostr

guide · 4 min read

Installer Ollama sur son serveur

Le conteneur, la carte graphique passée à Docker, et la commande la plus copiée d'Internet — celle qui ouvre votre modèle sur tout le réseau.

Ollama est la façon la plus courte de faire tourner un modèle chez soi : une commande pour l'installer, une pour télécharger un modèle, et il expose une API que le reste de vos outils sait appeler.

Ce guide part d'un Ubuntu Server avec Docker dessus — voir Installer Ubuntu Server et Installer Docker si ce n'est pas encore fait. Comptez vingt minutes, dont quinze d'attente pendant un téléchargement.

Avant de commencer : est-ce que ça tient dans votre carte ?

C'est la question qui décide, et elle se répond avant d'installer quoi que ce soit. Un modèle qui ne tient pas dans la mémoire de votre carte déborde en mémoire système, et la vitesse s'effondre — vous ne l'apprendrez pas d'un message d'erreur, mais d'une réponse qui met deux minutes à arriver.

Ce que votre matériel sait faire tourner donne le chiffre pour votre carte, et ce qu'un modèle réclame pour le sens inverse.

Sans carte graphique

Ça fonctionne, sur les petits modèles, et c'est lent. Autant le savoir plutôt que de découvrir la lenteur après l'installation.

docker run -d -v ollama:/root/.ollama -p 127.0.0.1:11434:11434 \
  --name ollama ollama/ollama

Notez le 127.0.0.1: devant le port. La commande que vous trouverez partout écrit -p 11434:11434, qui ouvre le service sur tout votre réseau. On y revient plus bas, parce que c'est le vrai piège de ce guide.

Avec une carte NVIDIA

Docker ne voit pas votre carte par défaut. Il faut lui donner le NVIDIA Container Toolkit, en cinq étapes — c'est là que tout le monde se bloque.

NVIDIA=https://nvidia.github.io/libnvidia-container
CLE=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg

curl -fsSL $NVIDIA/gpgkey | sudo gpg --dearmor -o $CLE

curl -s -L $NVIDIA/stable/deb/nvidia-container-toolkit.list \
  | sed "s#deb https://#deb [signed-by=$CLE] https://#g" \
  | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list

sudo apt-get update
sudo apt-get install -y nvidia-container-toolkit

sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

La ligne sed a l'air d'un détail de copier-coller. Elle réécrit le dépôt pour le rattacher à la clé qu'on vient de poser, et sans elle apt update refuse le dépôt comme non signé. C'est l'étape que la moitié des tutoriels oublient.

Puis le conteneur, avec la carte :

docker run -d --gpus=all -v ollama:/root/.ollama -p 127.0.0.1:11434:11434 \
  --name ollama ollama/ollama

Vérifiez qu'il la voit vraiment :

docker exec ollama nvidia-smi

Si la carte n'apparaît pas, le conteneur tourne quand même — sur le processeur, lentement, sans rien dire. C'est la panne silencieuse de ce guide, et cette commande est le seul moyen de la voir.

Le vrai piège : Ollama n'a aucun mot de passe

Il n'y a ni compte, ni jeton, ni la moindre authentification. Qui atteint le port 11434 pilote la machine : il peut télécharger des modèles, en supprimer, et consommer votre carte à votre place.

C'est pour ça que les commandes de ce guide écrivent -p 127.0.0.1:11434:11434 et non -p 11434:11434. La première n'écoute que sur la machine elle-même ; la seconde ouvre le service à tout votre réseau local — et si votre routeur redirige ce port, à tout Internet.

Pour y accéder depuis un autre appareil, deux chemins, et aucun des deux n'est « ouvrir le port » :

  • Tailscale relie vos appareils entre eux sans rien exposer ;
  • un reverse proxy avec authentification, si vous voulez y accéder depuis un navigateur.

Télécharger un modèle et lui parler

docker exec -it ollama ollama pull qwen3.5:9b
docker exec -it ollama ollama run qwen3.5:9b

Le premier téléchargement pèse plusieurs gigaoctets. Le second démarrage est immédiat : le modèle reste dans le volume ollama.

Pour vérifier que l'API répond, ce qui est ce dont vos autres outils auront besoin :

curl http://127.0.0.1:11434/api/tags

Ce que ce guide ne vous dira pas

Combien de jetons par seconde vous obtiendrez. Ça dépend de la bande passante mémoire de votre carte, du moteur, de la longueur du contexte et de celle des réponses — c'est un banc d'essai, pas une donnée, et personne ne peut vous le promettre pour votre configuration exacte.

Ce qu'on peut vous dire, en revanche, c'est ce qui rentre et ce que ça consomme. C'est calculé, page par matériel, sur le volet modèles.

Video

Hey Initium lance Ollama dans Docker et l'interroge par son API — la partie où l'on voit ce que les commandes produisent vraiment.

Nothing is sent to YouTube until you press play. This site sets no cookies of its own.Watch on YouTube