基于结构化表格决策模拟评估 LLM 理解能力
计算与语言
2025-11-17 v1 人工智能
机器学习
摘要
大型语言模型 (LLM) 常常在预测准确率方面取得令人印象深刻的成绩,但正确性本身并不等同于真正的理解。类似于人类专家家庭,真正的 LLM 理解需要在多个实例和多样领域中做出一致且基于正确决策因素的决定,依赖于相关且领域导向的决策因素。我们提出了结构化表格决策模拟 (STaDS),这是一个包含专家式决策情景的套件,用于将 LLM 评估为若干专业人士所进行的结构化决策“考试”。在此语境下,理解被定义为识别并依赖于正确决策因素的能力,这些因素是决定领域内结果的关键要素。STaDS 通过三个方面共同评估理解能力:(i) 问题和指令理解,(ii) 基于知识的预测,(iii) 依赖相关决策因素。通过分析 15 个领域多样化情景中的 9 个前沿 LLM,我们发现:(a) 大多数模型在跨领域实现持续稳健的准确率方面存在挑战;(b) 模型可以准确但在全局层面上不忠实,且在明确理由与驱动预测的因素之间存在频繁不匹配。我们的发现凸显了需要全局层面理解评估协议的必要性,并倡导开发超越准确率以提升 LLM 理解能力的新型框架。
引用
@article{arxiv.2511.10667,
title = {Evaluating LLM Understanding via Structured Tabular Decision Simulations},
author = {Sichao Li and Xinyue Xu and Xiaomeng Li},
journal= {arXiv preprint arXiv:2511.10667},
year = {2025}
}