最弱环的法则:大型语言模型的交叉能力
人工智能
2024-10-04 v2 计算与语言
计算机视觉与模式识别
摘要
大型语言模型(LLM)的开发与评估主要聚焦于单个能力,但忽略了跨越不同专业领域多种能力的交叉能力,这些能力常被要求用于实际任务。我们首次定义七种核心单一能力,并将其配对形成七种常见的交叉能力,每个交叉能力配备手动构建的分类框架。基于这些定义,我们引入CrossEval基准测试,包含1400个人工标注的提示,每个单一能力和交叉能力各100个提示。为确保评估可靠,我们邀请专家标注者评估4200个模型响应,收集8400个人类评级并附带详细说明作为参考示例。我们的发现表明,在静态评估和尝试增强特定能力的情况下,当前LLM始终表现出“最弱环法则”,即交叉能力性能显著受限于最弱的组成部分。具体而言,在17个模型的58个交叉能力得分中,38个得分低于所有单一能力得分,而20个得分介于强项和弱项之间,但更接近较弱项。这些结果凸显了LLM在交叉能力任务中的表现不足,使得识别和改进最弱能力成为未来研究的关键优先事项,以优化在复杂多维场景中的性能。
引用
@article{arxiv.2409.19951,
title = {Law of the Weakest Link: Cross Capabilities of Large Language Models},
author = {Ming Zhong and Aston Zhang and Xuewei Wang and Rui Hou and Wenhan Xiong and Chenguang Zhu and Zhengxing Chen and Liang Tan and Chloe Bi and Mike Lewis and Sravya Popuri and Sharan Narang and Melanie Kambadur and Dhruv Mahajan and Sergey Edunov and Jiawei Han and Laurens van der Maaten},
journal= {arXiv preprint arXiv:2409.19951},
year = {2024}
}
备注
Data, Code, & Benchmark: www.llm-cross-capabilities.org