2026-08-12
按住下方图标,点击小程序
免费领取AI学习资料、精选提示词

英伟达刚刚开源了一个专家混合架构模型NVIDIA Nemotron 3.5 Lightning 30B-A3B-NVFP4。
一共300亿参数,激活30亿参数,输出的效率是同类的4倍。最爽的是,消费级显卡就能跑这个模型。

开源地址:https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
咱们先说说这个混合架构设计,听起来挺玄乎,其实就是Mamba-2加MoE再加选择性注意力层的组合拳。
咱们只要记住一点,这种架构既保留了那种大模型才有的聪明脑袋,又把内存占用和计算成本给大幅砍下来了。
紧接着就是那个超长上下文支持,最高居然能支持到100万个token,你可以把整本大部头的书,甚至好几本书的内容一次性全喂给这个模型。

这对于那些平时要做长文档分析、长篇代码审查或者那种特别复杂的多轮对话来说很管用。
还有个不得不提的黑科技,就是那个推测解码技术,NVIDIA给它起了个名叫DSpark,专门为他们的DGX Spark硬件量身定制的。这就好比给你的车装了个涡轮增压,生成文本的速度能提升好几倍,而且质量还不会下降。
实际测试下来,在那种低并发的场景下,效率提升是真的明显,特别适合咱们这种个人用户或者小团队使用。
NVFP4量化把体积压到极致,英伟达搞了一套自己的4比特浮点量化方案,简单说就是把模型里每个数字从原来16比特甚至32比特的精度,压缩到只用4比特来存储。
这就好比把一本精装百科全书重新排版成口袋书,内容没丢多少,但体积缩小了好几倍。经过这个压缩之后,整个模型可能只需要不到10G显存就能跑起来。
推理速度真的对得起Lightning这个名号,既然叫闪电,那速度肯定是核心卖点。因为每次只激活3B参数,再加上FP4量化减少了数据搬运量,这个模型在推理时的吞吐量非常可观。

跑批量任务或者需要高并发响应的场景,优势会特别明显。以前同样的硬件可能一秒只能处理几个请求,现在能翻好几倍。
登录/注册后继续阅读
立即登录/注册 >