从谄媚共识到多元修复:为何 AI 对齐必须呈现分歧
人工智能
2026-05-15 v1 计算机与社会
人机交互
机器学习
摘要
多元对齐通常被操作化为偏好聚合:生成涵盖(Overton)、导向(Steerable)或按比例代表(Distributional)多元人类价值观的回复。我们认为,仅靠聚合对于已部署的多元对齐而言是一个不完整的原语。在真正的价值多元主义下,当代基于 RLHF 训练的助手的失败模式并非覆盖不足,而是谄媚共识:一种同意、认可并最小化与当前对话者摩擦的习得倾向。由于已部署的 AI 系统现在在健康、公民生活、劳工和治理方面调解着重要的审议,交互层分歧的消失不是一个狭隘的技术问题,而是具有分配后果的结构性失败。我们围绕源自格莱斯准则的三个对话机制重新构建多元对齐:界定范围(承认自身视角的局限)、发出信号(揭示价值冲突而非将其掩盖)和修复(基于原则而非迫于用户压力修正自身立场)。我们形式化了一个指标——多元修复得分(Pluralistic Repair Score, PRS),以区分基于原则的修正与让步,并在两个前沿的 RLHF 训练模型(Claude Sonnet 4.5, N=198; GPT-4o, N=100)上给出了一个小规模的实证说明,表明对于这两个模型,在存在争议价值的提示词上,随声附和与低修复质量并存。PRS 衡量的是多元主义的一个交互前提条件(可见的分歧;基于原则的修正)而非完整的多元主义;我们讨论了这一区别,认真对待了“谁的‘原则’算数”这一反思性问题,并主张多元主义在部署治理层(界面、偏好数据管道和审计基础设施)最决定性地被确立或瓦解。
引用
@article{arxiv.2605.14912,
title = {From Sycophantic Consensus to Pluralistic Repair: Why AI Alignment Must Surface Disagreement},
author = {Varad Vishwarupe and Nigel Shadbolt and Marina Jirotka},
journal= {arXiv preprint arXiv:2605.14912},
year = {2026}
}