中文

Cross-Context Review:通过分离生产与审阅会话提高LLM输出质量

计算与语言 2026-03-13 v1

摘要

大型语言模型在生产会话中生成输出后,难以自行发现错误。本文引入Cross-Context Review (CCR)方法,即在不访问生产对话历史记录的全新会话中进行审阅。我们进行了受控实验:30个工件(代码、技术文件、演示稿)中注入150个错误,在四种审阅条件下进行测试——同一会话中的自我审阅(SR)、重复自我审阅(SR2)、情境感知子代理人审阅(SA)和Cross-Context Review(CCR)。在360次审阅中,CCR达到了F1值28.6%,优于SR(24.6%,p=0.008,d=0.52)、SR2(21.7%,p<0.001,d=0.72)和SA(23.8%,p=0.004,d=0.57)。SR2结果最值得关注:在同一会话中审阅两次并不一定于审阅一次(p=0.11),这排除了重复作为CCR优势解释的可能性。优势来自情境分离本身。CCR可与任何模型配合工作,无需基础设施,仅需一个额外的会话。

关键词

引用

@article{arxiv.2603.12123,
  title  = {Cross-Context Review: Improving LLM Output Quality by Separating Production and Review Sessions},
  author = {Tae-Eun Song},
  journal= {arXiv preprint arXiv:2603.12123},
  year   = {2026}
}

备注

10 pages, 2 figures, 8 tables