中文

文档 haystack 中的语义针:LLM-as-a-Judge 相似度评分的灵敏度测试

计算与语言 2026-04-22 v1 人工智能 机器学习

摘要

我们提出了一个可扩展的、多因素的实验框架,系统性地探索 LLM 对成对文档比较中细微语义变化的敏感性。我们将其类比为针在 haystack 中的问题:单个在周围上下文中嵌入的语义被改动的句子(针)被置于 haystack 中,我们在所有组合中变化扰动类型(否定、连词交换、命名实体替换)、上下文类型(原始 vs. 主题无关)、针的位置以及文档长度,测试五个 LLM 在数万对文档对上的表现。我们的分析揭示了几个令人惊讶的发现。首先,LLM 在文档内部的位置偏差与此前研究的候选顺序效应不同:大多数模型在文档较早位置出现语义差异时更严厉地对其进行惩罚。其二,当被改动的句子被置于主题无关的上下文所包围时,系统地降低相似度评分并诱导出双极化评分,表明要么非常低的相似度,要么非常高的相似度。这一致于解释框架席卷模型,其中主题相关的上下文可能允许模型对调整进行上下文化并减轻其影响。第三,每个 LLM 产生具有不同特征的评分分布,这是一种稳定的“指纹”,其特征不随扰动类型而变,但所有模型都共享一种在如何温和地对待不同扰动类型的普遍层级。总之,这些结果表明,LLM 语义相似度评分对文档结构、上下文连贯性和模型身份的敏感性超越了语义变化本身,而提出的框架为审计和比较当前及未来模型的评分行为提供了实用的、LLM 非依赖性工具套件。

关键词

引用

@article{arxiv.2604.18835,
  title  = {Semantic Needles in Document Haystacks: Sensitivity Testing of LLM-as-a-Judge Similarity Scoring},
  author = {Sinan G. Aksoy and Alexandra A. Sabrio and Erik VonKaenel and Lee Burke},
  journal= {arXiv preprint arXiv:2604.18835},
  year   = {2026}
}

备注

15 pages, 8 figures