Auteur :
Pierre-Clément Cazon
Directeur de la publication.
NVIDIA élargit sa gamme d’IA ouvertes avec Nemotron 3.5 Lightning, lancé le 11 août 2026 pour les tâches répétitives des agents autonomes. Le constructeur l’accompagne de NeMo Switchyard, un système de routage capable de répartir les différentes étapes d’un agent entre plusieurs modèles.
Le principe consiste à réserver les modèles les plus puissants aux opérations complexes de planification ou de raisonnement, puis à confier les appels d’outils, validations, traitements structurés ou autres tâches réalisées en volume à un modèle plus léger.
Nemotron 3.5 Lightning est un modèle Mixture of Experts de 30 milliards de paramètres. Son architecture hybride combine des couches Mamba-2 et MoE avec certaines couches d’attention. Seuls 3 milliards de paramètres sont activés pour chaque token, ce qui limite la quantité de calcul mobilisée pendant l’inférence.
La fenêtre de contexte atteint jusqu’à un million de tokens. Le modèle traite du texte et prend en charge l’anglais, le français, l’espagnol, l’allemand, l’italien et le japonais, ainsi que des langages de programmation. NVIDIA propose notamment des versions BF16 et NVFP4 et intègre des couches Multi-Token Prediction destinées à la génération spéculative.
La version NVFP4 porte le numéro 1.0-preview depuis le 11 août 2026, tout en étant déclarée prête pour un usage commercial sous licence OpenMDW 1.1. NVIDIA destine cette variante aux agents autonomes, aux workflows agentiques et aux tâches d’exécution confiées à des sous-agents.
NeMo Switchyard fonctionne comme un proxy et une bibliothèque de routage pour les modèles de langage. Il peut diriger les requêtes vers plusieurs fournisseurs et traduire entre différents formats d’API, notamment OpenAI Chat, OpenAI Responses et Anthropic Messages.
Plusieurs stratégies de routage sont prévues. Un classificateur peut choisir entre un modèle léger et un modèle plus puissant à partir du contenu de la requête. Un routeur par étapes peut exploiter des signaux déjà présents dans la conversation, comme les résultats d’outils ou les erreurs. Un mécanisme d’escalade peut aussi commencer avec le modèle le moins coûteux avant de relancer la même demande sur un modèle plus puissant lorsque le résultat le nécessite.
Switchyard reste au stade pre-alpha. NVIDIA le classe comme logiciel expérimental, avec des API et des algorithmes susceptibles d’évoluer fortement avant la version 1.0, et exclut pour l’instant son utilisation en production.
NVIDIA annonce jusqu’à quatre fois plus de vitesse de sortie que des modèles ouverts de taille comparable. Sur PinchBench, le constructeur rapporte également un temps inférieur de 30 % pour accomplir 10 000 tâches face à Qwen3.6 35B à niveau de précision comparable.
Les évaluations indépendantes d’Artificial Analysis placent Nemotron 3.5 Lightning à 24 points sur son Intelligence Index, soit neuf points de plus que Nemotron 3 Nano. Lors d’une mesure réalisée avant la sortie sur un endpoint DeepInfra utilisant les poids NVFP4 définitifs, l’organisme a relevé une vitesse médiane proche de 670 tokens par seconde.
Le routage peut également réduire le coût d’un agent lorsque toutes les tâches ne nécessitent pas le modèle le plus puissant. Sur 145 tâches multi-tours de LangChain Deep Agents, l’utilisation de Switchyard a réduit le coût de 74 % en n’envoyant que 7 % des appels vers un modèle de pointe, avec une baisse de précision de 6 %.
Nemotron 3.5 Lightning peut fonctionner sur des systèmes locaux comme les PC NVIDIA RTX, Jetson et DGX Spark, ainsi que sur des stations de travail, des centres de données et des infrastructures cloud. LM Studio, llama.cpp, Ollama et Unsloth font partie des outils compatibles annoncés au lancement.
Pour les entreprises françaises et européennes, l’exécution locale ou sur site permet de conserver certaines charges de travail sur une infrastructure maîtrisée plutôt que de transmettre systématiquement les requêtes à une API distante. Ce mode de déploiement peut faciliter les politiques internes de contrôle des données, tout en restant soumis aux obligations applicables au traitement concerné, notamment au RGPD.
La zone de déploiement du modèle est mondiale et le français fait partie des langues officiellement prises en charge. Cette combinaison rend Lightning exploitable pour des agents francophones aussi bien dans des environnements locaux que dans des infrastructures hébergées.
Nemotron 3.5 Lightning est disponible sur Hugging Face et ModelScope pour le téléchargement des poids, ainsi que via OpenRouter et build.nvidia.com. NVIDIA le propose également sous forme de microservice NIM et par l’intermédiaire de plusieurs fournisseurs d’inférence.
La licence OpenMDW 1.1 autorise l’utilisation commerciale du modèle. NVIDIA publie également des données et des recettes d’entraînement dans les limites de leurs licences respectives, afin de permettre la personnalisation et le post-entraînement pour des tâches spécialisées.
NeMo Switchyard est distribué séparément sur GitHub. Le couple formé par Lightning et le routage illustre une architecture où un agent ne dépend plus nécessairement d’un modèle unique : le calcul peut être réparti entre plusieurs IA selon la complexité, la latence ou le coût de chaque opération.
Crédit image : NVIDIA Corporation.