中文

XChoice:面向约束性选择决策中 AI-人类对齐的可解释评估方法

人工智能 2026-01-19 v1

摘要

我们提出 XChoice,一个用于评估约束决策中 AI-人类对齐的可解释框架。移动出传统基于结果一致性(如准确率和 F1 分数)的评估方法,XChoice 拟合基于机制的决策模型至人类数据和大语言模型生成的决策,从而恢复可解释参数,捕捉决策因素的相对重要性、约束灵敏度以及隐含的权衡。通过比较这些参数向量在不同模型、选项和子组间的差异来评估对齐程度。我们在美国人日常时间分配上演示 XChoice,采用美国时间使用调查(ATUS)作为人类基准,揭示不同模型和活动之间的异质化对齐情况,并发现黑人和已婚群体中存在显著的误差。我们进一步通过不变性分析验证了 XChoice 的鲁棒性,并通过检索增强生成(RAG)干预评估了针对性缓解措施。总体而言,XChoice 提供基于机制的指标,用于诊断误差并支持超越表面结果匹配的知情改进。

关键词

引用

@article{arxiv.2601.11286,
  title  = {XChoice: Explainable Evaluation of AI-Human Alignment in LLM-based Constrained Choice Decision Making},
  author = {Weihong Qi and Fan Huang and Rasika Muralidharan and Jisun An and Haewoon Kwak},
  journal= {arXiv preprint arXiv:2601.11286},
  year   = {2026}
}