中文

大模型信息检索中的文本不安妥区

计算与语言 2026-05-11 v1 人工智能

摘要

现有大型语言模型(LLM)基准主要聚焦于语法正确的输入,忽略了对不完美文本的评估空白。本文研究词边界损坏如何影响 LLM 检测目标信息的能力。通过在单词中插入空白字符将其破坏为碎片,LLM 的检测准确率随插入率呈 U 形曲线。我们将该曲线称为文本不安妥区。为解释此现象,提出模式转换假说:LLM 在接近正常文本时 operates于单词级模式,而在严重碎片化文本中 operates于字符级模式, valley 标志着两者无效的有序转换区域。四项实验和一项分析均与此解释相吻合:in-context learning 无法挽救 valley 底部的性能;对扰动进行正则化显著降低 U 形;数学推理任务对 Gemini 3.0 Flash 复制 U 形,但对更强模型不复现,表明该效应在依赖精确词典对齐的任务中被削弱;且分词熵在 F1 最小值之前达到峰值,符合 regime-conflict 解释。这些发现揭示了干净文本基准下不可见的失效模式,却直接关联到任何涉及噪声或未筛选文本输入的部署场景。

关键词

引用

@article{arxiv.2605.07186,
  title  = {The Text Uncanny Valley: Non-Monotonic Performance Degradation in LLM Information Retrieval},
  author = {Zekai Tong and Ruiyao Xu and Aryan Shrivastava and Chenhao Tan and Ari Holtzman},
  journal= {arXiv preprint arXiv:2605.07186},
  year   = {2026}
}

备注

18 pages, 9 figures