关键词: 英伟达 Nemotron 3.5 Lightning AI智能体 开源大模型 NeMo Switchyard
英伟达在2026年8月11日正式发布了Nemotron 3.5 Lightning,这是一款面向长时运行智能体工作负载的开源模型,也是该公司在开源AI领域最新且最具针对性的产品。
Nemotron 3.5 Lightning的核心定位非常明确——它不是用来与GPT-5.6或Claude Opus 4.8争夺通用推理王座的,而是为了解决一个更实际的问题:在长时运行的智能体系统中,绝大多数计算资源都消耗在工具调用、结果验证和子任务委派这类高频执行环节上,如果每一步都调用前沿大模型,成本和延迟都会迅速失控。
这款模型采用了混合专家架构,总参数量为300亿,但每轮推理仅激活约30亿参数。这种设计使其在带宽受限的设备上也能保持极高的解码速度。它专为代码审查、工具调用、安全警报监控和账单问答等专项任务构建,能够在多智能体系统中承担高容量的执行工作。
在性能表现上,Nemotron 3.5 Lightning的输出速度比同类模型快约4倍,智能体任务完成速度提升30%。在衡量智能体实际工作效率的PinchBench基准测试中,它达到了86%的准确率,同时在完成10000个任务的速度上比同等准确率的Qwen3.6 35B快了约30%。在Artificial Analysis Intelligence Index这一综合九项评估的指标中,该模型也处于准确率与速度的帕累托前沿(Pareto frontier)。

该模型完全开源,企业可自由下载、使用、修改,无需获得许可或向英伟达付费。权重、训练数据和配方均在OpenMDW-1.1许可下发布,支持商业使用。企业可以通过LoRA或全量微调进行领域适配,也可以使用NeMo RL和NeMo Gym进行强化学习后训练。英伟达还发布了一个名为Nemotron-RL Agentic Terminal Pivot的强化学习数据集,专门用于提升编码智能体能力。
在部署层面,它支持从NVIDIA Jetson、GeForce RTX 5090到DGX Spark的本地运行,同时也兼容Ollama、llama.cpp、LM Studio等主流工具链。模型内置了多token预测能力以支持推测解码,并同步提供了DFlash和DSpark两个草稿模型,其中DSpark针对DGX Spark本地部署和低并发数据中心场景进行了优化。
与模型同步发布的还有NeMo Switchyard,这是一个开源的智能路由库。它的作用是在多模型系统中自动将每个请求分配给最适合的模型——复杂规划任务交给前沿大模型,高频执行工作交给Nemotron 3.5 Lightning。英伟达内部基准测试显示,这种路由策略可以将任务完成成本降至单独使用Opus 4.8的约三分之一。

LangChain在实际测试中将145个多轮深度智能体任务的成本降低了74%,仅将7%的调用路由至前沿模型,准确率折让约为6%。Ramp使用该工具后在SWE-Bench中匹配了前沿模型性能,同时成本降低58%、运行时间降低33%。Cognition将Switchyard集成至Devin Desktop后,在FrontierCode Main上实现了接近前沿的性能,平均成本相对单一前沿模型降低28%。
在Nemotron 3.5 Lightning发布的同一时间,关于下一代Nemotron 4的消息也开始浮出水面。据外媒报道,Nemotron 4的最大版本将拥有至少1万亿参数,这一目标直接对标全球顶级开源模型。该模型由Nemotron Coalition联合开发,目前最终训练尚未完成,最早可能在今年深秋发布,但英伟达尚未设定确定的发布日期,也未确认相关细节。
从参数规模来看,Nemotron 4与Nemotron 3.5 Lightning之间存在数量级的差距。前者是万亿级参数的前沿通用模型,旨在与全球最强的开源模型竞争;后者是300亿总参数级的专用执行模型,专注于在智能体工作流中处理高容量、低延迟的任务。两者在Nemotron家族中的分工也反映了英伟达的整体产品思路:前沿大型号负责复杂推理和编排,Nemotron 3.5 Lightning负责高频执行,而未来的Nemotron 4则有望在通用智能层面与闭源巨头正面交锋。
英伟达生成式AI副总裁Kari Briski在声明中表示,公司投资Nemotron是因为相信每家公司和每个国家都需要可获取的前沿开放模型,以加强安全与保障、加速创新,并提供一个可以代代相传的基础。这一表态与黄仁勋近期在美国的游说行动形成了呼应。
英伟达之所以大力投入开源模型,其底层商业逻辑在黄仁勋接受Axios采访时被一语道破:“免费AI应该有利于硬件,免费AI应该有利于芯片,免费AI应该有利于数据中心。”

(Axios采访黄仁勋报道标题)
这句话揭示了一个关键事实:开源模型本身可以免费获取,但运行这些模型所需的算力必须付费购买,而英伟达正是全球最大的算力供应商。对英伟达而言,开源AI是芯片销售的助推器,因为模型终究需要运行在GPU上,而更低的使用价格能够刺激用量,超过OpenAI和Anthropic等专有模型。
与此同时,英伟达正在积极游说美国政府支持开放模型。黄仁勋在7月首次于X平台发帖为开源模型辩护,并发布公开信呼吁政策制定者支持开放权重模型,同时“避免过早限制”以免将创新推向海外。他写道:“开放模型加强安全与网络安全,加速创新与普及,并实现主权。”这一行动的背景是中国开源模型的快速崛起,特别是月之暗面发布的Kimi K3缩小了与美国顶尖模型的差距,引发了华盛顿对国家安全和知识产权的担忧。英伟达随后与Microsoft等科技巨头签署公开信支持开放权重模型,并组建了AI安全联盟。

(黄仁勋在X平台上的首条推文)
从更宏观的视角看,英伟达的转型遵循着一条清晰的“从卖铲子到卖矿场”的路径。它不再满足于只做AI时代基础设施供应商的角色,而是试图通过CUDA生态、NIM微服务、Nemotron开源模型和NeMo工具链,构建一个从芯片到模型再到应用的全栈平台。当客户使用Nemotron模型时,他们自然会选择英伟达的GPU进行部署;当企业采用NeMo Switchyard进行模型路由时,它们也更倾向于留在英伟达的生态内。
来源:电子工程专辑