道德改变还是噪声?论将 AI 与时间不稳定的人类反馈对齐的问题
人机交互
2025-11-14 v1 人工智能
计算机与社会
摘要
道德领域中的对齐方法旨在获取人类利益相关者的道德偏好并将其纳入 AI。这预设了道德偏好是静态目标,但此类偏好通常会随时间演变。将 AI 与动态的人类偏好进行适当对齐,理想情况下应考虑道德推理的“合理”变化,同时忽略与注意力缺陷、认知偏差或其他任意因素相关的变化。然而,常见的 AI 对齐方法在很大程度上忽略了偏好的时间变化,这对正确的对齐构成了严峻挑战,尤其是在 AI 的高风险应用中,例如在医疗保健领域,不对齐可能会危及系统的可信度并造成严重的个人和社会伤害。本研究调查了人们的道德偏好随时间变化的程度,以及这种变化对 AI 对齐的影响。我们的研究以肾脏分配领域为基础,在 3-5 次会话中收集了超过 400 名参与者对假设肾脏移植患者成对比较的回答。我们发现,平均而言,参与者在不同时间呈现的相同场景中,大约有 6-20% 的时间会改变其回答(表现出“回答不稳定性”)。此外,我们观察到几位参与者的修正决策模型随时间发生显著偏移(捕获了“模型不稳定性”)。简单 AI 模型的预测性能会随着回答和模型不稳定性的增加而下降。此外,预测性能随时间衰减,突显了在训练期间考虑偏好时间变化的重要性。这些发现提出了与 AI 对齐相关的基本规范和技术挑战,突出了当用户偏好随时间显著变化时,更好地理解对齐对象(对齐到什么)的必要性。
引用
@article{arxiv.2511.10032,
title = {Moral Change or Noise? On Problems of Aligning AI With Temporally Unstable Human Feedback},
author = {Vijay Keswani and Cyrus Cousins and Breanna Nguyen and Vincent Conitzer and Hoda Heidari and Jana Schaich Borg and Walter Sinnott-Armstrong},
journal= {arXiv preprint arXiv:2511.10032},
year = {2025}
}
备注
To appear in the AAAI 2026 Alignment Track