中文

面向知识编辑器的原则性评估

计算与语言 2025-07-09 v1

摘要

知识编辑在过去几年中受到越来越多的关注。对于知识编辑而言,最近推出的评估数据集更具挑战性。这些数据集使用不同的方法对编辑器的成功进行评分。然而,这些方法的鲁棒性仍未得到充分探讨,是否对某些编辑器不公平地产生偏好也是一个持续的盲点。此外,这些编辑器对整体模型能力的潜在影响也始终是一个盲点。我们解决了这两个问题,表明选择不同的指标和评估方法以及不同的编辑批量大小会导致对知识编辑器的不同排名。关键的是,我们在一般语言理解任务(包括知识编辑任务)上演示了这一效果。我们还包括对基于字符串匹配的评估方法的手动评估,这种方法是由最近推出的数据集所偏好的,揭示了其产生虚假匹配匹配的倾向。

关键词

引用

@article{arxiv.2507.05937,
  title  = {Towards a Principled Evaluation of Knowledge Editors},
  author = {Sebastian Pohl and Max Ploner and Alan Akbik},
  journal= {arXiv preprint arXiv:2507.05937},
  year   = {2025}
}

备注

Accepted at L2M2 workshop at ACL 2025