2026-08-05
按住下方图标,点击小程序
免费领取AI学习资料、精选提示词

法国知名大模型平台Mistral刚开源了多模态安全分类模型Shieldstral-1.0-3B。
这是一个30亿参数模型,16G显存就能跑,完全可以在本地高效率部署。
Shieldstral-1.0-3B最大的亮点是不依赖那些固化的违规标签体系,推理的时候直接接收自然语言写成的安全审核规则,然后对文本、图片、图文混合的内容进行风险判定,最后输出一个连续型的安全置信分数。
用户完全可以根据需求自定义分数阈值,灵活决定拦截还是放行,整个过程不需要重新训练模型就能适配新的合规要求,可以节省大量开发时间。

开源地址:https://huggingface.co/mistralai/Shieldstral-1.0-3B
从架构细节来看,Shieldstral基于Ministral-3-3B-Base-2512底座构建,原生集成了Pixtral视觉编码器,单次前向推理就能完成内容风险判定,不用多轮调用。
该模型的核心创新点就是策略自适应,推理阶段直接传入自由格式的自然语言审核指令。
同一套模型权重就能适配各种全新的安全规范,彻底摆脱了传统安全模型改规则就要重训的困扰。
在跨分类体系适配测试里,F1分数居然达到了91.3%,这个成绩真的是相当亮眼。

不仅如此,Shieldstral还是原生多模态的,统一接口同时支持纯文本、纯图片、图文配对的内容审核,一套安全组件就能覆盖图文生成全链路的风险拦截。
多语言支持方面也做得比较全面,英语、法语、西班牙语、德语、意大利语、葡萄牙语、荷兰语、中文、日语、韩语等12种语言都覆盖了。
不过阿拉伯语和印尼语场景下的性能略低于主流基线,这是当前版本的已知局限,官方也表示后续迭代会持续优化多语言均衡表现。
上下文长度方面,训练阶段采用了最高32k的上下文序列,理论上支持256k的上下文窗口。
不过生产环境建议控制在32k以内以保障稳定性能,这个建议非常实用,毕竟长文本处理对推理压力确实不小。

再来看看大家最关心的安全性能对比。在公开和内部主流文本安全基准测试里,Shieldstral的文本识别能力可以对标参数量达到自身7倍的开源安全模型。
比如那些20B规模的模型,在多模态图文审核赛道上直接刷新了行业最优水平。
Shieldstral还能同步校验用户输入的提示词与大模型输出的文本,精准捕捉主生成模型遗漏的各类风险内容,这点特别重要,因为很多风险其实往往出在输入端。
举个具体的落地场景吧,比如内容营销机构经常使用大模型批量生成营销文案,很多时候会无意中产出一些冒犯性的表述或者提到竞品商标。
登录/注册后继续阅读
立即登录/注册 >