中文

不考虑上下文信息:评估 LLMs 对指示词的理解

计算与语言 2025-06-03 v1 人工智能

摘要

大型语言模型(LLMs)在共指消解相关任务中展现出了令人印象深刻的性能。然而,先前的研究大多评估 LLMs 在名词和第三人称代词共指消解上的性能。本研究评估了 LLMs 在诸如 I、you、here 和 tomorrow 等指示词共指消解上的性能,由于其语言学特性,这些指示词带来了独特的挑战。我们提出了首项研究 LLMs 如何解释英语指示词的工作,并发布了包含 1600 道多项选择题的英语指示词数据集。我们评估了前沿的 LLMs,包括 GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro 和 DeepSeek V3。我们的结果显示,LLMs 对某些指示词(I)表现出色,但在处理其他指示词(you、here、tomorrow)时存在困难;句法线索(如引号)有助于提升 LLMs 对某些指示词的性能,但会降低对其他指示词的性能。代码和数据可在以下地址获取:https://github.com/metehanoguzz/LLMs-Indexicals-English。

关键词

引用

@article{arxiv.2506.01089,
  title  = {Un-considering Contextual Information: Assessing LLMs' Understanding of Indexical Elements},
  author = {Metehan Oguz and Yavuz Bakman and Duygu Nur Yaldiz},
  journal= {arXiv preprint arXiv:2506.01089},
  year   = {2025}
}

备注

Accepted to ACL 2025 Findings