基于道德攻击的大语言模型破解
计算与语言
2026-04-21 v1
摘要
多元主义对齐 AI 旨在创建能够与并服从拥有多样道德观的 humanity 共存的 AI。为实现多元主义对齐,研究者们积极增强大语言模型 (LLM) 学习多元主义的能力。尽管这一目标至关重要,但 LLM 对于产生多元主义道德内容的鲁棒性仍值得探索。灵感来源于惊人的善意提示下的劝说能力,我们提出利用破解攻击来研究 LLM 内部的多元主义价值观。具体而言,我们构建了一个包含 10.3K 实例的道德数据集,分为 Value Ambiguity(价值模糊)和 Value Conflict(价值冲突)两个类别。我们进一步 formalized 四种对抗攻击,以所构建的数据集操纵 LLM 对道德问题的判断。我们评估了大语言模型和通常用于生成式系统的灵活用户输入的护栏模型。我们的实验结果表明,LLM 和护栏模型对这些微妙且高级的道德感知攻击存在关键漏洞。
引用
@article{arxiv.2604.17053,
title = {Jailbreaking Large Language Models with Morality Attacks},
author = {Ying Su and Mingen Zheng and Weili Diao and Haoran Li},
journal= {arXiv preprint arXiv:2604.17053},
year = {2026}
}
备注
27 pages, 6 figures, 18 tables. Accepted by ACL 2026 Findings