中文

规范冲突与浅层 AI 对齐

计算与语言 2025-06-06 v1

摘要

大语言模型等 AI 系统的进步引发越来越紧迫的安全部署担忧。本文审视了大语言模型的价值对齐问题,认为当前的对齐策略根本不足以防止滥用。尽管通过基于人类偏好的微调在大语言模型中灌输诸如有帮助性、诚实性和无害性等规范,但它们仍然 vulnerable to 利用这些规范之间冲突的对抗性攻击。我认为,这一 vulnerability 反映了现有对齐方法的根本局限:它们强化的是浅层的行为取向,而不是赋予大语言模型真正的规范 deliberation 能力。drawing from moral psychology research, 我展示了人类通过 deliberative reasoning 所增强的对抗性战术的韧性。相比之下,大语言模型缺乏健壮的能力来检测和理性解决规范冲突,使其易受操纵;即便是最近在推理方面取得进展的大语言模型,也未能解决这一 vulnerability。这种“浅层对齐”问题对 AI 安全和监管具有重大含义,表明当前方法不足以缓解日益有能力的 AI 系统可能造成的伤害。

关键词

引用

@article{arxiv.2506.04679,
  title  = {Normative Conflicts and Shallow AI Alignment},
  author = {Raphaël Millière},
  journal= {arXiv preprint arXiv:2506.04679},
  year   = {2025}
}

备注

Published in Philosophical Studies