中文

更多轮次,更多噪声:为何多轮审阅未能提升跨上下文验证

计算与语言 2026-03-18 v1

摘要

跨上下文审阅(Cross-Context Review, CCR)通过将生产与审阅分离到独立会话中,以显著提升大语言模型的验证效果。其自然的延伸是多轮审阅:让审阅者提出后续问题,接收作者的回应后再次审阅。我们称之为动态跨上下文审阅(Dynamic Cross-Context Review, D-CCR)。在一个受控实验中,我们针对30个作品注入150个错误,测试了四种D-CCR变体与单轮CCR基线。单轮CCR(F1=0.376)显著优于所有多轮变体,包括进行问答交互的D-CCR-2b(F1=0.303, p<0.001p<0.001, d=0.59d=-0.59)。多轮审阅提高了召回率(+0.08),但生成了62%更多的误报(8.5 vs. 5.2),使精度从0.30跌至0.20。两种机制驱动了这种恶化:(1) 误报压力——当作品的真实错误已被耗尽时,后续轮次的审阅者会捏造发现;(2) 审阅目标漂移——获得 prior Q&A 记录的审阅者会从审阅作品本身转向批判对话本身。独立审阅且无 prior context 的D-CCR-2c表现最差(F1=0.263),确认了仅靠重复会导致性能下降。这种下降源于额外轮次中的误报压力,而非信息量——在多轮条件下,更多信息实际上有帮助(D-CCR-2b > D-CCR-2a)。问题不在于审阅者看到的内容,而在于再次审阅本身会引入噪声。

关键词

引用

@article{arxiv.2603.16244,
  title  = {More Rounds, More Noise: Why Multi-Turn Review Fails to Improve Cross-Context Verification},
  author = {Song Tae-Eun},
  journal= {arXiv preprint arXiv:2603.16244},
  year   = {2026}
}

备注

10 pages, 2 figures