中文

揭示非语言无学习中的潜在风险:多语言 LLM 中的英文唯一无学习之危

计算与语言 2025-10-29 v1 人工智能

摘要

已有研究表明,仅使用英文数据尝试擦除多语言 LLM 中的多语言知识是不够的。然而,这些研究主要基于性能导向的分析。在本文中,我们转向评估视角,聚焦在 fully fine-tune 多语言 LLM 后使用平行多语言数据集进行无学习的额外盲点。当模型在输入提示的语言与输出语言之间发生混淆时,即模型以不同于输入提示语言作出回应。语言混淆是无学习中的一个问题现象,导致标准参考基于指标失效。我们针对这一现象提出了三步解决方案:(1)引入基于 N-gram 的语言混合 (N-Mix) 分数定量表明语言混淆在多语言 LLM 中普遍且一致;(2)演示当 N-Mix 分数较高时,参考基于指标会产生误报;(3)提出需要一种新的无学习评估方法,直接评估生成句子的内容。我们将这种类型的指标称为语义导向指标。

关键词

引用

@article{arxiv.2510.23949,
  title  = {Uncovering the Potential Risks in Unlearning: Danger of English-only Unlearning in Multilingual LLMs},
  author = {Kyomin Hwang and Hyeonjin Kim and Seungyeon Kim and Sunghyun Wee and Nojun Kwak},
  journal= {arXiv preprint arXiv:2510.23949},
  year   = {2025}
}