Ollama auf Jetson installieren: Der 5-Minuten-Start (mit Messwerten)

Vom frisch geflashten JetPack zu laufenden LLMs — ohne Cloud, ohne Abo. Hier der minimale Weg.

Schritt 1: Ollama installieren

curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable --now ollama

Dauert ca. 2 Minuten. Ollama erkennt die Orin-GPU automatisch (CUDA ist mit JetPack schon da).

Schritt 2: Ein Modell ziehen

ollama pull llama3.2:3b    # 2 GB, gut für den Einstieg
ollama run llama3.2:3b "Erkläre CUDA-Grids in drei Sätzen."

Schritt 3: Die API testen

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Nenne drei Vorteile lokaler LLMs",
  "stream": false
}'

Meine Hardware-Empfehlung aus der Praxis

  • Netzteil: mind. 45 W USB-C. Schwächere Netzteile sind die häufigste Fehlerquelle — der Orin throttelt dann mitten im Inferencing.
  • Kühlung: Der mitgelieferte Lüfter reicht für Desktop-Last. Für Dauerinferenz: aktiver Kühlkörper, sonst drosselt er nach Minuten.
  • GPU-Takt > TOPS-Zahl. Mit sudo jtop (pip3 install jetson-stats) siehst du live, ob er throttelt.

Nächste Schritte auf diesem Blog

Eine Messreihe mit gleichen Prompts über 5 Modelle (Tokens/s, RAM, Watt) ist in Arbeit. Wenn du sie lesen willst, schreib mir — webmaster@atlas.shrink2core.com.

Schreibe einen Kommentar