奖牌重要性:通过奥运排名探讨大语言模型的失败案例
计算与语言
2026-01-23 v3 人工智能
摘要
大型语言模型(LLMs)在自然语言处理任务中取得了显著的成功,但其内部知识结构仍然鲜为人知。本研究通过历史奥运奖牌榜的视角来考察这些结构,对 LLMs 在两个任务上的表现进行评估:(1)检索特定队伍的奖牌数量,(2)识别每支队伍的排名。虽然最先进的 LLMs 在回忆奖牌数量方面表现出色,但在提供排名方面则表现不足,这凸显了 LLMs 知识组织方式与人类推理之间的关键差异。这些发现揭示了 LLMs 内部知识集成的局限性,并为改进方向提供了启示。为促进进一步的研究,我们发布了代码、数据集和模型输出。
引用
@article{arxiv.2409.06518,
title = {Medal Matters: Probing LLMs' Failure Cases Through Olympic Rankings},
author = {Juhwan Choi and Seunguk Yu and JungMin Yun and YoungBin Kim},
journal= {arXiv preprint arXiv:2409.06518},
year = {2026}
}
备注
COLM 2025 ORIGen Workshop