你的大型语言模型是知识渊博还是仅凭选项就能作弊?
计算与语言
2024-07-03 v1
摘要
最近的研究表明,大型语言模型(LLMs)可以仅凭选项回答多选题,这是否意味着LLMs的多选题排行榜排名主要受选项唯一性设置能力的影响?为此,我们使用对比集来探测LLMs是否过度依赖选项唯一性捷径。虽然以往工作通过昂贵的人类标注或模型生成数据(可能受偏见影响)来构建对比集,但我们采用图挖掘技术从现有的多选题数据集中提取对比集。我们在UnifiedQA上应用该方法,这是一组六个常识推理数据集,在选项唯一性设置下准确率很高,从而构建了一个包含820个问题的对比集。经过验证我们的对比集后,我们测试了12个LLMs,发现这些模型在给定问题和选项时并不依赖选项唯一性捷径。因此,尽管多选题容易受到高选项唯一性准确率的影响,但我们认为LLMs并非仅凭其利用选项唯一性捷径的能力就能在多选题排行榜上获得高排名。
引用
@article{arxiv.2407.01992,
title = {Is Your Large Language Model Knowledgeable or a Choices-Only Cheater?},
author = {Nishant Balepur and Rachel Rudinger},
journal= {arXiv preprint arXiv:2407.01992},
year = {2024}
}
备注
KnowledgeLM Workshop @ ACL 2024