CDT:大语言模型跨认知、领域、任务的综合能力框架
计算与语言
2025-09-30 v1
摘要
近期大语言模型(LLM)的快速发展显著提升了其能力,凸显了需要超越任务特定基准的综合评估框架。然而,现有基准常关注孤立能力,缺乏全面衡量 LLM 能力的框架。为填补这一空白,本文提出认知-领域-任务(Cognition-Domain-Task, CDT)框架,全面衡量模型在三个维度上的能力。我们在认知层面引入卡特尔-霍尔-卡罗尔认知理论,细化了模型能力的分类。我们从两个方向应用 CDT:数据集能力评估和数据选择。实验表明,我们的能力指标与下游性能良好相关,可支持有效的数据集分析与构建。数据选择实验也显示出在通用和特定基准上分别实现了 44.3 和 45.4 分,分别比基线提高 1.6 和 2.2 分。这些结果验证了 CDT 的有效性和实用性。源代码和模型已公开:https://github.com/Alessa-mo/CDT。
关键词
引用
@article{arxiv.2509.24422,
title = {CDT: A Comprehensive Capability Framework for Large Language Models Across Cognition, Domain, and Task},
author = {Haosi Mo and Xinyu Ma and Xuebo Liu and Derek F. Wong and Yu Li and Jie Liu and Min Zhang},
journal= {arXiv preprint arXiv:2509.24422},
year = {2025}
}
备注
20 pages, 5 figures, EMNLP2025 Findings