中文

跨上下文验证:通过会话隔离分析发现基准污染的层次化检测方法

计算与语言 2026-04-02 v2

摘要

LLM编码基准面临可信度危机:广泛的解决方案泄露和测试质量问题动摇了 SWE-bench Verified 的可信度,而现有检测方法——改写一致性、n-gram 重叠、囊惑分析——从未直接观察模型是推理还是回忆。与此同时,简单重复验证会降低准确率:多轮审查比发现真实错误更快地产生假阳性结果,表明需要结构化方法。我们引入跨上下文验证(Cross-Context Verification, CCV),一种黑箱方法,通过在N个独立会话中解决相同的基准问题并衡量解的多样性;结合层次化跨上下文架构(Hierarchical Cross-Context Architecture, HCCA),一种通过在特定分析角色之间人为限制信息以防止确认偏差的多智能体分析框架。在9个 SWE-bench Verified问题(45次试验,Claude Opus 4.6,温度为0)上,CCV实现了对受污染与真实推理之间的完美分离(Mann-Whitney U=0, p≈0.012, r=1.0)。关键发现:(1) 污染是二元的——模型要么完美回忆,要么根本不回忆;(2) 推理缺失是完美的判别器;(3) 33%的先前污染标签是假阳性;(4) HCCA的独立分析结构发现了单分析师方法遗漏的污染-缺陷复合案例。我们发布了所有代码和数据。

关键词

引用

@article{arxiv.2603.21454,
  title  = {Cross-Context Verification: Hierarchical Detection of Benchmark Contamination through Session-Isolated Analysis},
  author = {Tae-Eun Song},
  journal= {arXiv preprint arXiv:2603.21454},
  year   = {2026}
}

备注

11 pages, 3 figures, 4 tables