EditPropBench:测量科学手稿中事实编辑传播
计算与语言
2026-05-06 v2 人工智能
摘要
科学手稿中的局部事实编辑常常引发非局部修订义务。若数据集从215篇更改为80篇,诸如“中等规模”或“几百项”等表述也可能变得过时,尽管其未重复编辑数值。我们审查了近期arXiv cs.CL基准与数据集论文,发现37.2%的论文包含事实依赖的定性论断,表明该依赖模式在目标体裁中较为常见。我们引入EditPropBench,作为衡量LLM编辑器是否传播事实编辑通过依赖手稿论断的基准。每个项目包含一个ML/NLP风格的合成手稿、一个针对性编辑,以及一个受控事实图,标注句子层面的直接目标、必需的下游更新以及不相关文本(应保持不变)。我们以Edit-Ripple Adherence (ERA)概括级联成功率,即必需的下游更新正确修订的比例,并通过对抗探针与压力测试变体验证该指标。在最具挑战性的案例中(即依赖论断采用隐式或非结构化表述而非重复编辑数值),五个LLM编辑系统的ERA范围为0.148-0.705。即便是最强的系统也遗漏约30%的必需级联更新。该优势在包含易解案例(可通过确定性替换解决)的混合评估中仍然存在。EditPropBench表明当前LLM编辑器可修复许多事实编辑的隐式后果,但可靠的科学修订仍需级联感知检查。
关键词
引用
@article{arxiv.2605.02083,
title = {EditPropBench: Measuring Factual Edit Propagation in Scientific Manuscripts},
author = {Garvin Kruthof},
journal= {arXiv preprint arXiv:2605.02083},
year = {2026}
}