NVIDIA Nemotron 3 5 Lightning in Ollama  Bild © PCMasters.deNVIDIA Nemotron 3 5 Lightning in Ollama (Bild © PCMasters.de)

Architektur und lokale Ausführung

Nemotron 3.5 Lightning nutzt eine hybride Mixture of Experts (MoE)-Architektur. Das Modell enthält zwar insgesamt 30 Milliarden Parameter, pro Token sind jedoch nur 3 Milliarden aktiv. Dieses Design reduziert den Rechenaufwand für die Inferenz erheblich, sodass es sich für lokale Systeme eignet und keine Ressourcen im Rechenzentrumsmaßstab benötigt.

Das Modell ist mit verschiedener Hardware kompatibel, darunter NVIDIA GeForce RTX-Karten, RTX Pro-Workstations sowie DGX Spark- oder Station-GPUs. Für Nutzer mit Apple-Silicon steht über Ollama eine spezielle MLX-Version zur Verfügung, um die Leistung auf diesen spezifischen Chips zu optimieren. Da das Modell lokal läuft, verbleiben alle verarbeiteten Daten auf dem Gerät des Nutzers.

Technische Spezifikationen und Leistung

Das Modell verfügt über ein Kontextfenster von 1 Million Token, wodurch es umfangreiche Informationsmengen in einer einzigen Sitzung verarbeiten kann. Um die Effizienz zu steigern, hat NVIDIA neben den Technologien DFlash und DSpark auch spekulatives Decodieren mittels Multi-Token-Prediction (MTP) implementiert. Diese Optimierungen können zu einem bis zu viermal höheren Durchsatz im Vergleich zu ähnlichen Open-Source-Modellen führen.

Als offenes Modell, das auf offenen Datensätzen trainiert wurde, lässt sich Nemotron 3.5 Lightning weiter anpassen. Entwickler können das Modell für spezielle Aufgaben nachtrainieren und die resultierende Version in verschiedenen Umgebungen einsetzen, von Edge-Geräten bis hin zur Cloud-Infrastruktur.

Name Größe / Usage Context Input
nemotron-3.5-lightning:latest 25GB 1M Text
nemotron-3.5-lightning:30b 25GB 1M Text
nemotron-3.5-lightning:30b-a3b 25GB 1M Text
nemotron-3.5-lightning:30b-a3b-mlx 23GB 256K Text
nemotron-3.5-lightning:30b-a3b-mlx-bf16 66GB 256K Text
nemotron-3.5-lightning:30b-a3b-mxfp8 34GB 256K Text
nemotron-3.5-lightning:30b-a3b-nvfp4 23GB 256K Text
nemotron-3.5-lightning:30b-a3b-q4_K_M 25GB 1M Text
nemotron-3.5-lightning:30b-a3b-q8_0 35GB 1M Text
nemotron-3.5-lightning:30b-a3b-bf16 66GB 1M Text
nemotron-3.5-lightning:30b-mlx 23GB 256K Text

Anwendungen für agentenbasierte Workloads

Die Architektur ist für Aufgaben optimiert, die das Lesen von Dateien, den Aufruf externer Tools, das Sortieren von Ergebnissen und die Ausführung von Wiederholungslogik bei Fehlern umfassen. Zu den wichtigsten Anwendungsfällen gehören:

  • Persönliche Assistenten: Verwaltung von E-Mails, Kalendern und Terminen unter Verwendung lokaler Kontextdaten, ohne Daten nach außen zu übertragen.
  • Sub-Agenten für die Programmierung: Integration in bestehende Entwicklungsumgebungen, um Codebasen zu durchsuchen, Tests auszuführen und Refactorings durchzuführen.
  • Sicherheitsoperationen: Klassifizierung von Vorfällen, Abfrage von Protokollen und Korrelation von Indikatoren, um strukturierte Berichte für Analysten zu erstellen.
  • Hybride Bereitstellung: Funktioniert als lokale Ebene, die einfache Schritte mit hohem Datenaufkommen abwickelt, bevor komplexe Abfragen über dieselbe API an ein größeres gehostetes Modell weitergeleitet werden.

Ollama Nemotron 3.5 Lightning deployen

Nutzer können Nemotron 3.5 Lightning über Ollama mit Standard-CLI-Befehlen bereitstellen. Das Modell ist mit mehreren Agent-Frameworks kompatibel, darunter Claude Code, OpenClaw, Hermes Agent und OpenCode. Diese Integration ermöglicht es Agenten, einzelne Schritte lokal auszuführen oder bestimmte Anfragen an größere Modelle in der Cloud weiterzuleiten, ohne die primäre Anwendungslogik zu verändern.

General chat

ollama run nemotron-3.5-lightning

Claude Code

ollama launch claude --model nemotron-3.5-lightning

OpenClaw

ollama launch openclaw --model nemotron-3.5-lightning

Hermes Agent

ollama launch hermes --model nemotron-3.5-lightning

OpenCode

ollama launch opencode --model nemotron-3.5-lightning