中文

切除得分:以外科手术精准度评估编辑

机器学习 2025-12-16 v2

摘要

许多任务围绕文档编辑展开,无论是代码还是文本。我们构建修订相似度问题,以统一广泛的机器学习评估问题,其目标是评估对现有文档的修订。我们观察到,修订通常仅改变文档的小部分,因此现有文档与其直接修订在内容上共享大部分。我们提出五个充分性准则,用于衡量修订相似度,旨在与人类判断一致。我们指出,像 BLEU 等流行成对度量措�因其得分被共享内容主导,无法满足这些准则。当人类认为两个修订相当不同时,这些度量仍报告高相似度。这是一个根本性缺陷,我们通过提出一种新型静态度量——切除得分(Excision Score, ES)来解决。ES 计算最长公共子序列(LCS),用于删除现有文档与真实修订及预测修订共享的内容,再仅比较剩余的发散区域。这类似于外科医生创建无菌场所以聚焦于工作区域。我们采用近似方法将标准的三次 LCS 计算加速为二次。在代码编辑评估中,静态度量常被用作通过测试的廉价代理,我们展示 ES 在提升现有度量方面具有优势。相较于最近的竞争者 SARI,ES 在 HumanEvalFix 上的 Pearson 相关性提升 12%,对标准度量如 BLEU 提升超过 21%。关键准则是对共享上下文的不变性;当我们对 HumanEvalFix 进行增加共享上下文的扰动时,ES 对 SARI 的改进提升至 20%,对标准度量超过 30%。ES 还处理其他一些其他度量无法处理的边界情况,例如正确对齐移动代码块,以及对匹配的插入或删除给予适当奖励。

关键词

引用

@article{arxiv.2510.21537,
  title  = {Excision Score: Evaluating Edits with Surgical Precision},
  author = {Nikolai Gruzinov and Ksenia Sycheva and Earl T. Barr and Alex Bezzubov},
  journal= {arXiv preprint arXiv:2510.21537},
  year   = {2025}
}

备注

Code is available at https://anonymous.4open.science/r/excision-score-eval-B9AF/