中文

信任典型:基于典型性检测的大语言模型安全框架

计算与语言 2026-02-05 v1 人工智能 分布式、并行与集群计算 机器学习

摘要

当前针对大语言模型安全的做法本质上依赖于识别并阻止已知威胁的脆弱猫鼠游戏式方法。我们认为应采用新的方法:健壮的安全性并非源于枚举有害内容,而是源于深入理解什么是安全的。我们提出了信任典型(Trust The Typical,T3)框架,通过将安全性建模为离分布(out-of-distribution,OOD)检测问题来实现这一原则。T3 在语义空间中学习可接受提示的分布,并将显著偏离作为潜在威胁的信号。不同于先前方法,T3 无需针对有害示例进行训练,却在覆盖毒性、仇恨言论、劫持、多语言伤害及过度拒绝等 18 个基准测试上实现最先进性能,将误报率相较于专用安全模型降低最高可达 40 倍。一个仅在安全英文文本上训练的单一模型可有效迁移至多样化领域和 14 多种语言,无需重新训练。最后,我们通过将 GPU 优化版本集成至 vLLM,实现了在大规模工作负载下的生产环境就绪,使其在密集评估间隔下进行持续监护,开销不足 6%。

关键词

引用

@article{arxiv.2602.04581,
  title  = {Trust The Typical},
  author = {Debargha Ganguly and Sreehari Sankar and Biyao Zhang and Vikash Singh and Kanan Gupta and Harshini Kavuru and Alan Luo and Weicong Chen and Warren Morningstar and Raghu Machiraju and Vipin Chaudhary},
  journal= {arXiv preprint arXiv:2602.04581},
  year   = {2026}
}