Vom frisch geflashten JetPack zu laufenden LLMs — ohne Cloud, ohne Abo. Hier der minimale Weg.
Schritt 1: Ollama installieren
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable --now ollama
Dauert ca. 2 Minuten. Ollama erkennt die Orin-GPU automatisch (CUDA ist mit JetPack schon da).
Schritt 2: Ein Modell ziehen
ollama pull llama3.2:3b # 2 GB, gut für den Einstieg
ollama run llama3.2:3b "Erkläre CUDA-Grids in drei Sätzen."
Schritt 3: Die API testen
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Nenne drei Vorteile lokaler LLMs",
"stream": false
}'
Meine Hardware-Empfehlung aus der Praxis
- Netzteil: mind. 45 W USB-C. Schwächere Netzteile sind die häufigste Fehlerquelle — der Orin throttelt dann mitten im Inferencing.
- Kühlung: Der mitgelieferte Lüfter reicht für Desktop-Last. Für Dauerinferenz: aktiver Kühlkörper, sonst drosselt er nach Minuten.
- GPU-Takt > TOPS-Zahl. Mit
sudo jtop(pip3 install jetson-stats) siehst du live, ob er throttelt.
Nächste Schritte auf diesem Blog
Eine Messreihe mit gleichen Prompts über 5 Modelle (Tokens/s, RAM, Watt) ist in Arbeit. Wenn du sie lesen willst, schreib mir — webmaster@atlas.shrink2core.com.