中文

当选择变成风险:多选约束下的大语言模型安全失效

计算与语言 2026-04-21 v1

摘要

大语言模型(LLM)的安全对齐主要在开放式生成场景下评估,此时模型可通过拒绝回应来缓解风险。相比之下,许多实际应用会将LLM置于结构化决策任务中,如多选题(MCQs),其中不鼓励或无法中止。我们在此场景下识别出一种系统性失效模式:将有害请求重新表述为强制选择MCQs(所有选项均不安全),可系统性地绕过拒绝行为,即使在对等的开放式提示下持续拒绝的模型也会如此。我们在14个专有和开源模型上表明,强制选择约束显著增加政策违规响应。值得注意的是,针对人类编写的MCQs,违规率随结构约束强度呈倒U型趋势,在中等任务规格下达到峰值;而由高能力模型生成的MCQs则在各种约束下几乎达到饱和,表现出强大的跨模型可迁�性。我们的发现表明,当前的安全评估在结构化任务设置下严重低估了风险,凸显受限决策是对齐失效的关键且尚未被充分探索的表面。

关键词

引用

@article{arxiv.2604.16916,
  title  = {When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints},
  author = {Yuheng Chen and Zhiyu Wu and Bowen Cheng and Tetsuro Takahashi},
  journal= {arXiv preprint arXiv:2604.16916},
  year   = {2026}
}