探索大语言模型的次级风险
机器学习
2026-04-28 v5 人工智能
密码学与安全
摘要
确保大语言模型的安全性和对齐性是随着其越来越多地集成到关键应用和社会功能中而面临的重要挑战。虽然先前研究主要关注越狱攻击,但对在良性交互中微妙出现的非对抗性失败关注较少。我们引入次级风险——一类以良性提示中的有害或误导性行为为特征的新型失败模式。与对抗性攻击不同,这些风险源于不完美的泛化,往往规避标准安全机制。为实现系统性评估,我们引入了两个风险基元:冗长响应和推测性建议,以捕捉核心失败模式。基于这些定义,我们提出了SecLens,一个黑盒多目标搜索框架,通过优化任务相关性、风险激活和语言合理性来高效激发次级风险行为。为支持可复现评估,我们发布了SecRiskBench,一个包含650个提示的基准数据集,涵盖八个多样化的真实世界风险类别。在16个流行模型上的广泛评估实验结果表明,次级风险普遍存在,可在模型间迁移且与模态无关,强调了需要增强安全机制来应对现实世界部署中良性但有害的LLM行为的紧迫性。
引用
@article{arxiv.2506.12382,
title = {Exploring the Secondary Risks of Large Language Models},
author = {Jiawei Chen and Zhengwei Fang and Yu Tian and Jiawei Du and Chao Yu and Zhaoxia Yin and Hang Su},
journal= {arXiv preprint arXiv:2506.12382},
year = {2026}
}
备注
18 pages, 5 figures