CLM-Bench:面向跨语言误差的大语言模型知识编辑基准测试
计算与语言
2026-01-27 v1
摘要
知识编辑(KE)已成为一种更新大语言模型(LLM)中事实信息的有前景的范式。然而,多语言知识编辑(MKE)的进展目前受限于偏见的评估框架。我们观察到,现有的MKE基准测试通常通过机械方式将以英文为中心的数据集翻译至目标语言(例如英文到中文),这种方法引入翻译伪影,忽视目标语言本土文化特有的实体,无法反映大语言模型的真实知识分布。为此,我们提出CLM-Bench,一种采用本土中文优先方法构建的文化感知基准测试。我们策划了1,010组高质量的CounterFact配对,这些配对植根于中文文化语境,并与英文对应配对对齐。通过CLM-Bench,我们对代表性大语言模型(例如Llama-3、Qwen2)进行大规模实验,揭示了显著的跨语言误差:一种语言中的编辑是独立工作的,无法传递至另一种语言。我们进一步通过层级表示分析提供了几何解释,表明中文和英文的编辑向量几乎正交——位于互不相交的子空间中,而混合语言编辑则表现为这些向量的线性可加性。我们的发现挑战了当前方法在跨语言迁移中的有效性,强调了文化本土化基准测试的重要性。
引用
@article{arxiv.2601.17397,
title = {CLM-Bench: Benchmarking and Analyzing Cross-lingual Misalignment of LLMs in Knowledge Editing},
author = {Yucheng Hu and Wei Zhou and Juesi Xiao},
journal= {arXiv preprint arXiv:2601.17397},
year = {2026}
}
备注
EACL MME workshop paper