大语言模型的分类性能被高估了
计算与语言
2024-07-04 v3
摘要
在许多为人工智能或人类设计的分类任务中,金标标签通常默认包含在标签空间中,常以“以下哪项正确?”的形式呈现。这一标准设置传统上凸显了先进人工智能,特别是顶尖大语言模型(LLM)在常规分类任务中的强大性能。然而,当金标标签被刻意排除在标签空间之外时,发现即使如此,大语言模型仍会尝试从可用标签备选中进行选择,尽管这些备选中没有正确选项。这引出一个关键问题:大语言模型是否在理解分类任务的本质方面展现出其智能?本文评估了闭源和开源大语言模型在代表性分类任务中的表现,论证其感知到的性能被高估,因其无法展现对任务的预期理解。本文作出三方面的贡献:i) 据我们所知,这是首次识别大语言模型在金标标签缺失时分类任务中的局限性。我们将此任务定义为 Classify-w/o-Gold,并将其提出作为大语言模型的新基准测试。ii) 我们引入了一个基准测试 Know-No,包含两个现有分类任务和一个新任务,用于评估 Classify-w/o-Gold。iii) 本文定义并倡导一种新的评估指标 OmniAccuracy,用于评估大语言模型在金标标签存在与否时的分类性能。
关键词
引用
@article{arxiv.2406.16203,
title = {LLMs' Classification Performance is Overclaimed},
author = {Hanzi Xu and Renze Lou and Jiangshu Du and Vahid Mahzoon and Elmira Talebianaraki and Zhuoan Zhou and Elizabeth Garrison and Slobodan Vucetic and Wenpeng Yin},
journal= {arXiv preprint arXiv:2406.16203},
year = {2024}
}