自然上下文漂移削弱大语言模型的自然语言理解能力
计算与语言
2025-09-03 v1 人工智能
摘要
上下文段落的自然演变如何影响生成式大语言模型(LLMs)的问答?为了研究这一问题,我们提出了一个框架,用于从当代 QA 基准中策划自然演变、人工编辑的阅读段落变体,并用于分析 LLM 在一系列语义相似度分数下的表现,这些分数量化了每个变体与预训练期间所见内容的紧密程度。使用该框架,我们评估了六个 QA 数据集和八个具有公开可用训练数据的 LLM。我们的实验表明,随着阅读段落与预训练期间遇到的版本自然偏离,LLM 的性能会下降——即使在推理时问题和所有必要信息仍然存在。例如,在 BoolQ 上,从最高相似度区间到最低相似度区间,模型平均准确率下降了 30% 以上,多个 LLM 的下降斜率超过 70。这些发现表明,自然文本演变对 LLM 的语言理解能力构成了重大挑战。
引用
@article{arxiv.2509.01093,
title = {Natural Context Drift Undermines the Natural Language Understanding of Large Language Models},
author = {Yulong Wu and Viktor Schlegel and Riza Batista-Navarro},
journal= {arXiv preprint arXiv:2509.01093},
year = {2025}
}
备注
EMNLP 2025 Findings