中文

阅读场景而非剧本:面向LLM的基于结果的安全

计算与语言 2025-10-07 v1 机器学习

摘要

安全对齐的大型语言模型(LLM)仍显示两种主要失效模式:它们容易被越狱,或过度拒绝包含敏感表面信号的无害输入。我们追溯到共同原因:当前模型对行动与结果之间的关联推理较弱,过度依赖表面形式信号,词汇或风格线索,这些线索不编码后果。我们将此失效模式定义为结果盲性(Consequence-blindness)。为了研究结果盲性,我们构建了一个名为CB-Bench的数据集,覆盖四种风险情景,分别考察语义风险是否与结果风险一致,从而在匹配和不匹配条件下进行评估,这些条件通常被现有安全基准忽略。主流模型一致地未能区分这些风险,表现出结果盲性,表明结果盲性是普遍且系统性的。为了缓解结果盲性,我们引入CS-Chain-4k,一个用于安全对齐的后果推理数据集。对CS-Chain-4k进行微调的模型在抵御语义伪装越狱方面显示出明显的性能提升,并减少了对无害输入的过度拒绝,同时在其他基准测试中保持实用性和泛化能力。这些结果阐明了当前对齐的局限性,确立了基于结果的推理作为核心对齐目标,并提供了更实用且可重复的评估路径。

关键词

引用

@article{arxiv.2510.04320,
  title  = {Read the Scene, Not the Script: Outcome-Aware Safety for LLMs},
  author = {Rui Wu and Yihao Quan and Zeru Shi and Zhenting Wang and Yanshu Li and Ruixiang Tang},
  journal= {arXiv preprint arXiv:2510.04320},
  year   = {2025}
}