NVIDIA Nemotron 3 5 Lightning in Ollama (Bild © PCMasters.de)
Architektur und lokale Ausführung
Nemotron 3.5 Lightning nutzt eine hybride Mixture of Experts (MoE)-Architektur. Das Modell enthält zwar insgesamt 30 Milliarden Parameter, pro Token sind jedoch nur 3 Milliarden aktiv. Dieses Design reduziert den Rechenaufwand für die Inferenz erheblich, sodass es sich für lokale Systeme eignet und keine Ressourcen im Rechenzentrumsmaßstab benötigt.
Das Modell ist mit verschiedener Hardware kompatibel, darunter NVIDIA GeForce RTX-Karten, RTX Pro-Workstations sowie DGX Spark- oder Station-GPUs. Für Nutzer mit Apple-Silicon steht über Ollama eine spezielle MLX-Version zur Verfügung, um die Leistung auf diesen spezifischen Chips zu optimieren. Da das Modell lokal läuft, verbleiben alle verarbeiteten Daten auf dem Gerät des Nutzers.
Technische Spezifikationen und Leistung
Das Modell verfügt über ein Kontextfenster von 1 Million Token, wodurch es umfangreiche Informationsmengen in einer einzigen Sitzung verarbeiten kann. Um die Effizienz zu steigern, hat NVIDIA neben den Technologien DFlash und DSpark auch spekulatives Decodieren mittels Multi-Token-Prediction (MTP) implementiert. Diese Optimierungen können zu einem bis zu viermal höheren Durchsatz im Vergleich zu ähnlichen Open-Source-Modellen führen.
Als offenes Modell, das auf offenen Datensätzen trainiert wurde, lässt sich Nemotron 3.5 Lightning weiter anpassen. Entwickler können das Modell für spezielle Aufgaben nachtrainieren und die resultierende Version in verschiedenen Umgebungen einsetzen, von Edge-Geräten bis hin zur Cloud-Infrastruktur.
| Name | Größe / Usage | Context | Input |
|---|---|---|---|
| nemotron-3.5-lightning:latest | 25GB | 1M | Text |
| nemotron-3.5-lightning:30b | 25GB | 1M | Text |
| nemotron-3.5-lightning:30b-a3b | 25GB | 1M | Text |
| nemotron-3.5-lightning:30b-a3b-mlx | 23GB | 256K | Text |
| nemotron-3.5-lightning:30b-a3b-mlx-bf16 | 66GB | 256K | Text |
| nemotron-3.5-lightning:30b-a3b-mxfp8 | 34GB | 256K | Text |
| nemotron-3.5-lightning:30b-a3b-nvfp4 | 23GB | 256K | Text |
| nemotron-3.5-lightning:30b-a3b-q4_K_M | 25GB | 1M | Text |
| nemotron-3.5-lightning:30b-a3b-q8_0 | 35GB | 1M | Text |
| nemotron-3.5-lightning:30b-a3b-bf16 | 66GB | 1M | Text |
| nemotron-3.5-lightning:30b-mlx | 23GB | 256K | Text |
Anwendungen für agentenbasierte Workloads
Die Architektur ist für Aufgaben optimiert, die das Lesen von Dateien, den Aufruf externer Tools, das Sortieren von Ergebnissen und die Ausführung von Wiederholungslogik bei Fehlern umfassen. Zu den wichtigsten Anwendungsfällen gehören:
- Persönliche Assistenten: Verwaltung von E-Mails, Kalendern und Terminen unter Verwendung lokaler Kontextdaten, ohne Daten nach außen zu übertragen.
- Sub-Agenten für die Programmierung: Integration in bestehende Entwicklungsumgebungen, um Codebasen zu durchsuchen, Tests auszuführen und Refactorings durchzuführen.
- Sicherheitsoperationen: Klassifizierung von Vorfällen, Abfrage von Protokollen und Korrelation von Indikatoren, um strukturierte Berichte für Analysten zu erstellen.
- Hybride Bereitstellung: Funktioniert als lokale Ebene, die einfache Schritte mit hohem Datenaufkommen abwickelt, bevor komplexe Abfragen über dieselbe API an ein größeres gehostetes Modell weitergeleitet werden.
Ollama Nemotron 3.5 Lightning deployen
Nutzer können Nemotron 3.5 Lightning über Ollama mit Standard-CLI-Befehlen bereitstellen. Das Modell ist mit mehreren Agent-Frameworks kompatibel, darunter Claude Code, OpenClaw, Hermes Agent und OpenCode. Diese Integration ermöglicht es Agenten, einzelne Schritte lokal auszuführen oder bestimmte Anfragen an größere Modelle in der Cloud weiterzuleiten, ohne die primäre Anwendungslogik zu verändern.
General chat
ollama run nemotron-3.5-lightning
Claude Code
ollama launch claude --model nemotron-3.5-lightning
OpenClaw
ollama launch openclaw --model nemotron-3.5-lightning
Hermes Agent
ollama launch hermes --model nemotron-3.5-lightning
OpenCode
ollama launch opencode --model nemotron-3.5-lightning
