中文

负向方法实现 AI 对齐:为何负约束在结构上优于正偏好

人工智能 2026-03-18 v1

摘要

最近的实证结果表明,使用仅负向反馈训练的大语言模型(LLM)可与标准强化学习从人类反馈(RLHF)相当或更好。负样本强化在数学推理方面实现与 PPO 相同的水平;分布式不偏好优化仅使用不偏好样本进行训练;宪法 AI 在善意基准测试中超越纯粹的 RLHF。然而,尚无统一的理论阐述解释为何负信号如此有效。本文提出了这样的解释:正偏好(“哪个更好”)编码的是连续耦合、情境依赖的人类价值观,这些价值观无法详尽指定——导致模型学习表面关联项,如对用户的妥协(sycophancy)。负约束(“什么是错误的”)编码的是离散、有限且可独立验证的禁止事项,可收敛到稳定的边界。这种不对称性——根植于波普尔的归谬逻辑和负知识的认识论——解释了偏好基 RLHF 中的sycophancy 失败以及负信号方法的意外有效性。我们认为,对齐研究应将重心从“学习人类偏好”转向“学习人类拒绝”,并为此框架提供可测试的预测。

关键词

引用

@article{arxiv.2603.16417,
  title  = {Via Negativa for AI Alignment: Why Negative Constraints Are Structurally Superior to Positive Preferences},
  author = {Quan Cheng},
  journal= {arXiv preprint arXiv:2603.16417},
  year   = {2026}
}

备注

9 pages, position paper