中文

ActTraitBench: 通过人类 grounding 行为验证量化大型语言模型的知识-决策鸿沟

计算与语言 2026-05-29 v1

摘要

虽然大型语言模型(LLM)可以令人信服地模拟人格在显式自报告中,但在隐式行为决策中常常出现偏差,这揭示了 substantial 的知识-决策鸿沟(GKDG_{\text{KD}})。现有基准测试在衡量这一不对称性方面困难,因为其 construct validity 有限,多维度耦合,以及 LLM 基于评估中的分布偏差。为此,我们提出 ActTraitBench,一个以人类为 grounding 的评估框架,用于衡量 LLM 中人格一致性。基于实证人类数据,ActTraitBench 在心理测量 facets 与行为范式之间建立一对一映射,并应用分布校准通过分位数映射程序将 LLM-judge 评分分布与人类规范对齐。对 14 个主流 LLM 的实验揭示,普遍存在的知识-决策不对称,尽管 self-report 高度一致,但更大且更具能力的模型常常表现出更强的行为偏差。为缓解这一鸿沟,我们进一步引入认知对齐链(CoCA),一种即插即用的数据推理时干预,在推理能力较强的前沿模型中改善对齐,同时暴露了较小架构的明确能力限制。

关键词

引用

@article{arxiv.2605.29791,
  title  = {ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation},
  author = {Yutong Yang and Chenxi Miao and Weikang Li and Yunfang Wu},
  journal= {arXiv preprint arXiv:2605.29791},
  year   = {2026}
}