Local AI auf Jetson: Ollama in der Praxis (mit Messwerten)

Der Hauptgrund, einen Jetson zu kaufen: LLMs ohne Cloud betreiben. Hier meine Messwerte, keine Marketingzahlen.

Ollama installieren

curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3.2:3b        # kleines Modell für den Einstieg

Was realistisch läuft

Am besten laufen quantisierte Modelle (Q4/Q8 GGUF). Wichtigste Regel aus der Praxis: GPU-Takt > TOPS-Zahl — ein Modell mit hohem Takt liefert flüssige Antworten, wo ein niedriger getakteter Chip stockt.

Benchmarks kommen

Dieser Blog misst nach: Tokens/s, RAM-Verbrauch, Leistungsaufnahme in Watt — mit jtop beobachtet, auf dem echten Gerät. Follow-up-Artikel mit Messreihen sind in Arbeit.

Schreibe einen Kommentar