StartAINVIDIA Agenten-KI-Modelle erreichen mit Nemotron 3.5 Lightning die vierfache Geschwindigkeit

NVIDIA Agenten-KI-Modelle erreichen mit Nemotron 3.5 Lightning die vierfache Geschwindigkeit

NVIDIA treibt agentische KI-Modelle weiter voran mit der Einführung von Nemotron 3.5 Lightning, einem neuen offenen Modell, das speziell für die Art von stets aktiven, hochvolumigen Aufgaben entwickelt wurde, die autonome KI-Agenten inzwischen rund um die Uhr übernehmen. Parallel dazu veröffentlichte das Unternehmen NeMo Switchyard, ein Open-Source-Routing-Tool, das jede KI-Anfrage an das Modell leitet, das sie am schnellsten und günstigsten bearbeiten kann. Zusammen markieren die beiden Veröffentlichungen NVIDIAs jüngsten Versuch, agentische KI-Systeme nicht nur intelligenter, sondern auch wirklich effizient im großen Maßstab betreibbar zu machen.

Wichtigste Erkenntnisse

  • NVIDIA hat Nemotron 3.5 Lightning veröffentlicht, ein offenes 30-Milliarden-Parameter-Mixture-of-Experts-Modell, das für agentische KI-Workloads mit hohem Volumen entwickelt wurde.
  • Das Modell liefert eine bis zu 4-fach höhere Ausgabegeschwindigkeit und 30 % schnellere Aufgabenerledigung als vergleichbare Modelle seiner Klasse.
  • NVIDIA hat außerdem NeMo Switchyard eingeführt, eine Open-Source-Routing-Bibliothek, die die Kosten für die Aufgabenerledigung auf nahezu ein Drittel im Vergleich zur Nutzung eines einzelnen Frontier-Modells senken kann.
  • Nemotron 3.5 Lightning läuft lokal auf NVIDIA RTX PCs, DGX Spark, DGX Station und Jetson oder skaliert in Rechenzentren und in die Cloud.
  • Beide Veröffentlichungen sind offen, anpassbar und werden bereits von Ökosystempartnern wie CrowdStrike, Harvey, CodeRabbit und Lila Sciences unterstützt.

NVIDIA bringt Nemotron 3.5 Lightning für agentische KI-Workloads auf den Markt

Nemotron 3.5 Lightning ist die neueste Ergänzung der Nemotron-3-Familie von NVIDIA, und das Unternehmen beschreibt es als das effizienteste Modell seiner Klasse für lang laufende agentische Aufgaben. Es folgt auf Nemotron 3 Nano und setzt ein Muster fort, dem NVIDIA bei jeder Nemotron-Veröffentlichung gefolgt ist: offene Gewichte, Anpassbarkeit und rohe Geschwindigkeit werden gegenüber schierer Größe priorisiert.

Ein 30-Milliarden-Parameter-Modell, das auf Geschwindigkeit ausgelegt ist

Nemotron 3.5 Lightning ist ein Mixture-of-Experts-Modell mit 30 Milliarden Parametern. Das bedeutet, dass nur die Teile seines Netzwerks aktiviert werden, die für eine bestimmte Aufgabe benötigt werden, anstatt jedes Mal das gesamte Modell auszuführen. Diese Designentscheidung schlägt sich direkt in der Leistung nieder: NVIDIA sagt, dass das Modell eine bis zu 4-fach höhere Ausgabegeschwindigkeit liefert, was sich in einer 30 % schnelleren Erledigung agentischer Aufgaben im Vergleich zu anderen Modellen seiner Größenklasse niederschlägt. Laut internen PinchBench-Benchmarks, auf die sich NVIDIA beruft, werden diese Geschwindigkeitsgewinne ohne Einbußen bei der Genauigkeit im Vergleich zu Modellen der gleichen Klasse erzielt.

Das Modell ist für eine spezifische Rolle innerhalb größerer Multi-Agenten-Systeme konzipiert. Anstatt zu versuchen, einen gesamten Workflow eigenständig zu planen, soll Nemotron 3.5 Lightning enge, repetitive Aufgaben mit hohem Volumen übernehmen – die Art von Arbeit, die sich schnell ansammelt, wenn ein KI-Agent kontinuierlich läuft, anstatt nur auf gelegentliche Eingaben zu reagieren.

Anpassung und Post-Training für domänenspezifische Genauigkeit

Da Nemotron 3.5 Lightning offen ist, können Organisationen es mit NVIDIA NeMo anhand ihrer eigenen Domänendaten, internen Tools und Workflows nachtrainieren. Diese offene Anpassung von KI-Modellen steht im Zentrum von NVIDIAs Positionierung der Veröffentlichung: Anstelle eines Einheitsmodells erhalten Unternehmen eine Basis, die auf eine bestimmte Aufgabe zugeschnitten werden kann – sei es das Analysieren von Rechtsverträgen oder das Markieren von Sicherheitswarnungen.

Mehrere Unternehmen haben genau das bereits getan. CrowdStrike passt das Modell für Cybersecurity-Workloads an, Harvey arbeitet mit Trajectory an Anwendungen für juristische Dienstleistungen, und CodeRabbit hat es mit Baseten für automatisierte Code-Reviews kombiniert. Lila Sciences nutzt es, um das Reasoning in Aufgaben der Physik und Lebenswissenschaften zu verbessern, während Fastino Labs von führender Genauigkeit berichtet, nachdem das Modell für Workloads in Softwareentwicklung, Finanzen und Gesundheitswesen abgestimmt wurde. NVIDIA sagt, dass das Modell mit Input von der Nemotron Coalition entwickelt wurde, deren Mitglieder Bewertungsmethoden, Inferenzsoftware und Datensätze beigesteuert haben, die die finale Veröffentlichung mitgeprägt haben.

NeMo Switchyard bringt intelligentes Routing zu KI-Agenten

NeMo Switchyard löst ein Problem, das mit wachsender Skalierung agentischer Systeme größer wird: Die Abhängigkeit von einem einzigen Standardmodell verschwendet entweder Geld für Aufgaben, die kein intensives Reasoning erfordern, oder beeinträchtigt die Qualität, wenn ein leichtgewichtiges Modell mit zu viel belastet wird. NVIDIAs Antwort ist eine Open-Source-Bibliothek, die automatisch – Anfrage für Anfrage – entscheidet, welches Modell die Aufgabe übernehmen soll.

Kostensenkung durch dynamische Modellauswahl

NeMo Switchyard leitet jeden Schritt des Workflows eines Agenten an das Modell weiter, das für diese spezifische Aufgabe am leistungsfähigsten und kosteneffizientesten ist, ohne dass Entwickler ihre Anwendungen neu schreiben müssen. Entwickler können den Routing-Algorithmus abstimmen oder austauschen, je nachdem, was ihnen am wichtigsten ist – Latenz, Qualität oder Kosten. NVIDIAs interne Benchmarks zeigen, dass dieser NeMo-Switchyard-Routing-Ansatz eine Genauigkeit nahe der von Frontier-Modellen beibehält, während die Kosten für die Aufgabenerledigung auf nahezu ein Drittel dessen gesenkt werden, was es kosten würde, alles ausschließlich über Opus 4.8 laufen zu lassen.

Diese Lücke ist relevant. In Systemen, in denen Agenten kontinuierlich laufen, summiert sich der Unterschied zwischen intelligentem Routing und der Standardnutzung eines einzelnen Modells schnell über Tausende täglicher Aufgaben – und verwandelt einen scheinbar moderaten Effizienzgewinn in eine spürbare Reduzierung der Betriebskosten im Zeitverlauf.

Integration im gesamten KI-Ökosystem

NVIDIA arbeitet bereits mit einer Vielzahl von Partnern zusammen, um dieses Routing direkt in Tools zu bringen, die Entwickler täglich nutzen. Erste Ergebnisse aus dieser Ökosystemarbeit zeigen, wie stark Routing Kosten und Leistung verschieben kann:

  • Boomi erreichte 100 % Routing-Genauigkeit auf Domänenebene, während 59 % des Traffics an ein 5-mal schnelleres feinabgestimmtes Modell gesendet wurden, wodurch die Latenz in späteren Turns um 21 % gesenkt wurde.
  • Cognition integrierte einen gestuften Router in Devin Desktop und reduzierte die durchschnittlichen Kosten um 28 % im Vergleich dazu, alles an ein einzelnes Frontier-Modell zu routen.
  • LangChain senkte die Kosten über 145 mehrstufige Deep-Agents-Aufgaben hinweg um 74 %, indem nur 7 % der Aufrufe an ein Frontier-Modell gesendet wurden – bei einem Genauigkeitskompromiss von 6 %.
  • Ramp erreichte die gleiche Leistung wie Frontier-Modelle, während die Kosten um 58 % und die Laufzeit in seinen SWE-Bench-Tests um 33 % reduziert wurden.
  • Classmethod berichtete von einer Kostenreduktion um 27 % bei gleichbleibender Qualität über seine opencode- und Fireworks-Workloads hinweg.

Kong, LiteLLM, Nous Research, Cadence und Siemens integrieren oder benchmarken NeMo Switchyard ebenfalls innerhalb ihrer eigenen Plattformen – von KI-Gateways bis hin zu formaler Chip-Verifikation und Engineering-Agenten.

Flexible Bereitstellung auf NVIDIA-Hardware

Einer der größten Pluspunkte dieser Veröffentlichung ist, wo Nemotron 3.5 Lightning tatsächlich laufen kann. Es unterstützt lokale und Cloud-Bereitstellung auf NVIDIA RTX PCs, DGX Spark, DGX Station und Jetson-Geräten, sodass Organisationen Hardware nutzen können, die sie bereits besitzen, anstatt alles in die Cloud zu verlagern. Von dort aus skaliert es auf RTX PRO Workstations, Edge-Geräte, Rechenzentren und vollständige Cloud-Umgebungen für größere Enterprise-Bereitstellungen.

Diese Flexibilität gibt Organisationen echte Kontrolle über Datenschutz und Latenz. Die Ausführung des Modells lokal oder On-Premises eignet sich für hochvolumige, spezialisierte Aufgaben, die schnelle Antworten und strengere Datenkontrolle erfordern, während die Cloud-Bereitstellung für Workloads verfügbar bleibt, die bei Bedarf skalieren müssen.

Offene Daten und Plattformverfügbarkeit

Wie bei jeder Nemotron-Veröffentlichung sagt NVIDIA, dass es so viele Trainingsdaten und -techniken veröffentlicht, wie es die Lizenzierung zulässt, sodass externe Forscher die Möglichkeit haben, nachzuvollziehen, zu prüfen und sogar andere Modelle auf demselben Material zu trainieren. Parallel zu Lightning veröffentlicht NVIDIA Nemotron-RL-Agentic-Terminal-Pivot, einen agentischen Reinforcement-Learning-Datensatz, der zum Post-Training des Modells für Coding-Agent-Aufgaben verwendet wurde.

Nemotron 3.5 Lightning ist jetzt auf Hugging Face, ModelScope und OpenRouter verfügbar, ebenso wie auf build.nvidia.com als NVIDIA NIM-Microservice, mit breiterem Zugang über NVIDIA Cloud Partners, Post-Training-Plattformen und zusätzliche Cloud-Service-Provider. NeMo Switchyard ist ab heute auf GitHub verfügbar, mit Unterstützung für weitere Partnerplattformen in Kürze.

FAQ

Was ist Nemotron 3.5 Lightning und was macht es besonders?

Nemotron 3.5 Lightning ist ein offenes KI-Modell mit 30 Milliarden Parametern, das für agentische KI-Aufgaben mit hohem Volumen optimiert ist und bis zu 4-fach schnellere Ausgaben und 30 % schnellere Aufgabenerledigung als vergleichbare Modelle liefert.

Wie verbessert NeMo Switchyard die Effizienz von KI?

NeMo Switchyard ist eine Open-Source-Routing-Bibliothek, die KI-Anfragen dynamisch an das am besten geeignete Modell weiterleitet und die Kosten für die Aufgabenerledigung auf etwa ein Drittel im Vergleich zur Nutzung eines einzelnen Modells senkt.

Kann Nemotron 3.5 Lightning für spezifische Anforderungen einer Organisation angepasst werden?

Ja. Nemotron 3.5 Lightning kann mit NVIDIA NeMo anhand der eigenen Daten einer Organisation nachtrainiert werden, um die Genauigkeit für spezialisierte, domänenspezifische Aufgaben zu verbessern.

Auf welchen Plattformen ist Nemotron 3.5 Lightning für die Bereitstellung verfügbar?

Nemotron 3.5 Lightning unterstützt lokale und Cloud-Bereitstellung auf NVIDIA RTX PCs, DGX-Systemen, Jetson- und Edge-Geräten und ist auf Plattformen wie Hugging Face, ModelScope, OpenRouter und NVIDIA Cloud Partners verfügbar.

{„@context“:“https://schema.org“,“@type“:“FAQPage“,“mainEntity“:[{„@type“:“Question“,“name“:“Was ist Nemotron 3.5 Lightning und was macht es besonders?“,“acceptedAnswer“:{„@type“:“Answer“,“text“:“Nemotron 3.5 Lightning ist ein offenes KI-Modell mit 30 Milliarden Parametern, das für agentische KI-Aufgaben mit hohem Volumen optimiert ist und bis zu 4-fach schnellere Ausgaben und 30 % schnellere Aufgabenerledigung als vergleichbare Modelle liefert.“}},{„@type“:“Question“,“name“:“Wie verbessert NeMo Switchyard die Effizienz von KI?“,“acceptedAnswer“:{„@type“:“Answer“,“text“:“NeMo Switchyard ist eine Open-Source-Routing-Bibliothek, die KI-Anfragen dynamisch an das am besten geeignete Modell weiterleitet und die Kosten für die Aufgabenerledigung auf etwa ein Drittel im Vergleich zur Nutzung eines einzelnen Modells senkt.“}},{„@type“:“Question“,“name“:“Kann Nemotron 3.5 Lightning für spezifische Anforderungen einer Organisation angepasst werden?“,“acceptedAnswer“:{„@type“:“Answer“,“text“:“Ja. Nemotron 3.5 Lightning kann mit NVIDIA NeMo anhand der eigenen Daten einer Organisation nachtrainiert werden, um die Genauigkeit für spezialisierte, domänenspezifische Aufgaben zu verbessern.“}},{„@type“:“Question“,“name“:“Auf welchen Plattformen ist Nemotron 3.5 Lightning für die Bereitstellung verfügbar?“,“acceptedAnswer“:{„@type“:“Answer“,“text“:“Nemotron 3.5 Lightning unterstützt lokale und Cloud-Bereitstellung auf NVIDIA RTX PCs, DGX-Systemen, Jetson- und Edge-Geräten und ist auf Plattformen wie Hugging Face, ModelScope, OpenRouter und NVIDIA Cloud Partners verfügbar.“}}]}

Artikel mit Unterstützung von künstlicher Intelligenz erstellt und von der Redaktion überprüft.

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST