中文

SteeringSafety:表示引导在大语言模型中系统性安全评估框架

人工智能 2025-10-17 v2 计算与语言 机器学习

摘要

我们引入SteeringSafety,一个用于评估表示引导方法在七个安全视角上的系统框架,覆盖17个数据集。虽然先前工作突出了表示引导的通用能力,但我们系统性地探索了包括偏见、有害性、幻觉、社会行为、推理、认识论完整性以及规范判断在内的七个安全视角。我们的框架提供了面向最新技术引导方法的模块化构建块,使DIM、ACE、CAA、PCA和LAT能够统一实现,包括最近的条件引导等最新改进。针对Gemma-2-2B、Llama-3.1-8B和Qwen-2.5-7B的实验结果显示,强大的引导性能取决于方法、模型与特定视角的匹配。DIM表现出始终如一的有效性,但所有方法都显示出显著的 entanglement:社会行为显示出最高的脆弱性(性能下降最高可达76%),破解常常会损害规范判断,而幻觉引导则会不可预测地转移政治观点。我们的发现凸显了进行整体性安全评估的critical需求。

关键词

引用

@article{arxiv.2509.13450,
  title  = {SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs},
  author = {Vincent Siu and Nicholas Crispino and David Park and Nathan W. Henry and Zhun Wang and Yang Liu and Dawn Song and Chenguang Wang},
  journal= {arXiv preprint arXiv:2509.13450},
  year   = {2025}
}