理论追踪卡:大语言模型的社会认知评估的理论驱动
人工智能
2026-01-06 v1 计算机与社会
摘要
社会认知基准测试对于大型语言模型(LLM)往往无法预测实际行为,即使模型在基准测试中取得高分。先前的工作将这一评估-部署之间的差距归因于测量和有效性问题。尽管这些批评具有洞察力,但我们认为它们忽略了一个更根本的问题:许多社会认知评估在没有对目标能力进行明确理论规格的情况下进行,使得将任务性能与能力能力联系的假设是隐含的。在没有这种理论基础的情况下,仅练习能力子集的基准测试会被误解为广泛能力的证据:这一差距通过掩盖对其他关键维度的评估失败,制造了系统性的有效性幻觉。为解决这一差距,我们做出两个贡献。首先,我们诊断并正式化了这一理论差距作为一种根本性的失败,这削弱了测量并使基准测试结果的系统性过度泛化成为可能。其次,我们引入了理论追踪卡(Theory Trace Card, TTC),一种旨在 accompany 社会认知评估的轻量级文档制品,明确概述了该评估的理论基础、目标能力的组成部分、其操作化以及其局限性。我们认为,TTC 通过使完整的有效性链(将理论、任务操作化、评分和局限性链接起来)变得可见,而无需修改基准测试或达成关于单一理论的共识,来增强社会认知评估的可解释性和可重用性。
引用
@article{arxiv.2601.01878,
title = {Theory Trace Card: Theory-Driven Socio-Cognitive Evaluation of LLMs},
author = {Farzan Karimi-Malekabadi and Suhaib Abdurahman and Zhivar Sourati and Jackson Trager and Morteza Dehghani},
journal= {arXiv preprint arXiv:2601.01878},
year = {2026}
}