产品信号

NVIDIA发布Nemotron 3.5 Lightning

NVIDIA扩展Nemotron 3模型家族,推出Nemotron 3.5 Lightning,并以NeMo Switchyard加入代理任务的多模型路由能力。

NVIDIA已发布Nemotron 3.5 Lightning,并同步推出NeMo Switchyard,用于在代理工作流中按任务特征路由不同模型。这个变化的核心不只是新增一款开放模型,而是NVIDIA开始把长程代理推理的模型效率与运行时调度放进同一套产品叙事。

从单一模型扩展到代理工作负载

NVIDIA称,Nemotron 3.5 Lightning面向长程agentic AI工作负载,并定位为同类中效率最高的模型。它扩展了此前的Nemotron 3产品线:NVIDIA此前已将该系列定义为开放、强调效率的混合Mamba-Transformer MoE模型,并披露最高100万token上下文等能力边界。新发布因而意味着该系列从通用推理模型继续向需要长上下文、连续工具调用和多步骤执行的代理任务推进。

效率竞争开始依赖路由层

NeMo Switchyard的作用是把代理请求按模型的能力、成本和适配性分配,而不是让所有任务固定运行在一个模型上。NVIDIA的技术说明指出,不同模型的优势、弱点和成本会随任务变化。此前NVIDIA对Nemotron 3 Super披露的测试显示,在特定B200、长输入长输出和优化推理配置下,其吞吐可高于若干对比模型;这些结果说明,代理经济性不仅取决于参数规模,也取决于模型选择和推理配置是否被动态管理。

开放模型部署的竞争面扩大

对企业而言,开放模型的价值通常不止于可下载权重,还包括是否能在自有环境中控制成本、数据位置和任务路径。NVIDIA此次把Lightning与Switchyard并列发布,显示其希望覆盖这一部署层。不过,NVIDIA同时披露,现有nemo-relay-switchyard插件仍属实验性、默认构建未启用,且计划由原生插件替代。这使当前信号更接近产品方向已经明确,而非路由层已经完全成熟。

接下来关注什么

接下来可观察三类证据:NVIDIA是否公布Nemotron 3.5 Lightning的权重、API或主要云平台可用范围;是否给出跨真实代理任务的成本、延迟和成功率对照;以及Switchyard原生插件能否按计划进入稳定版本并获得第三方部署案例。这些信息将直接检验其效率主张能否转化为可复用的企业代理基础设施。

信源