迈向认知忠实型决策模型以改进 AI 对齐
机器学习
2026-05-26 v2
摘要
近期的 AI 趋势致力于将 AI 模型与学习到的人类中心目标(如个人偏好、效用或社会价值观)相对齐。研究人员和从业者使用标准的偏好获取方法构建人类决策与判断模型,并将 AI 模型向其对齐。然而,标准的获取方法往往无法捕捉人类决策背后的认知过程,例如启发式方法或简化的结构化思维模式。为了解决这一缺陷,我们采用公理化方法从成对比较中学习认知忠实的决策过程。基于分析塑造人类决策的认知过程的相关文献,我们推导出一类模型,其中特征首先通过学习到的规则进行处理,然后通过固定规则(如 Bradley-Terry 规则)进行聚合以做出决策。这种结构化的信息处理确保了此类模型是代表潜在人类决策过程的现实且可行的候选者。我们通过在肾脏分配任务中学习人类决策的可解释模型,展示了该建模方法的有效性,并表明我们提出的模型匹配或超越了先前人类成对决策模型的准确率。
引用
@article{arxiv.2509.04445,
title = {Towards Cognitively-Faithful Decision-Making Models to Improve AI Alignment},
author = {Cyrus Cousins and Vijay Keswani and Vincent Conitzer and Hoda Heidari and Jana Schaich Borg and Walter Sinnott-Armstrong},
journal= {arXiv preprint arXiv:2509.04445},
year = {2026}
}
备注
In ICLR 2026