用于忘却语言模型的均值教师算法
机器学习
2025-04-21 v1 计算与语言
摘要
语言模型忘却的一个目标是减少所选文本实例的记忆,同时保留模型的通用能力。尽管提出了 various 方法,但在不明显降低模型实用性的前提下减少大型数据集记忆仍然具有挑战性。本文我们考察了均值教师算法 (Tarvainen & Valpola, 2017),这是一种来自持续学习文献中用于逐渐修改教师模型的简单proximal优化方法。我们展示了均值教师可以近似 slow natural gradient descent (NGD) 的轨迹,这种方法本质上寻求低曲率更新,不太可能降低模型实用性。尽管 slow NGD 可能 suffer from vanishing gradients,我们引入一种新的忘却损失,称为 "negative log-unlikelihood" (NLUL),以避免这一问题。我们表明,均值教师和 NLUL 的组合在 MUSE benchmark (Shi et al., 2024) 上改善了一些指标。
引用
@article{arxiv.2504.13388,
title = {A mean teacher algorithm for unlearning of language models},
author = {Yegor Klochkov},
journal= {arXiv preprint arXiv:2504.13388},
year = {2025}
}