规范冲突与浅层 AI 对齐
计算与语言
2025-06-06 v1
摘要
大语言模型等 AI 系统的进步引发越来越紧迫的安全部署担忧。本文审视了大语言模型的价值对齐问题,认为当前的对齐策略根本不足以防止滥用。尽管通过基于人类偏好的微调在大语言模型中灌输诸如有帮助性、诚实性和无害性等规范,但它们仍然 vulnerable to 利用这些规范之间冲突的对抗性攻击。我认为,这一 vulnerability 反映了现有对齐方法的根本局限:它们强化的是浅层的行为取向,而不是赋予大语言模型真正的规范 deliberation 能力。drawing from moral psychology research, 我展示了人类通过 deliberative reasoning 所增强的对抗性战术的韧性。相比之下,大语言模型缺乏健壮的能力来检测和理性解决规范冲突,使其易受操纵;即便是最近在推理方面取得进展的大语言模型,也未能解决这一 vulnerability。这种“浅层对齐”问题对 AI 安全和监管具有重大含义,表明当前方法不足以缓解日益有能力的 AI 系统可能造成的伤害。
引用
@article{arxiv.2506.04679,
title = {Normative Conflicts and Shallow AI Alignment},
author = {Raphaël Millière},
journal= {arXiv preprint arXiv:2506.04679},
year = {2025}
}
备注
Published in Philosophical Studies