学习与遗忘:多语言大语言模型中的信息误传问题
计算与语言
2025-09-04 v3 机器学习
摘要
本文探讨了有害信息在多语言大型语言模型(LLM)中的传播路径,并评估了各种遗忘方法的有效性。我们表明,无论其语言如何,一旦虚假信息通过训练数据被引入这些模型,就会在不同语言之间传播,从而损害生成内容的完整性和可靠性。我们的发现表明,通常仅针对英文数据进行的遗忘技术在多语言语境下不足以缓解有害内容的传播,甚至可能无意中强化跨语言的有害内容。我们进一步表明,只有通过同时针对英文和有害数据原始语言中的有害响应,才能有效消除所有语言的生成。这一发现凸显了在现代LLM的多语言性质下,制定全面的遗忘策略以提升其跨语言安全性和可靠性的关键性。
引用
@article{arxiv.2406.13748,
title = {Learn and Unlearn: Addressing Misinformation in Multilingual LLMs},
author = {Taiming Lu and Philipp Koehn},
journal= {arXiv preprint arXiv:2406.13748},
year = {2025}
}
备注
EMNLP 2025 Main Conference