模型在不同语言功能下的不学习目标各不相同
计算与语言
2026-05-27 v1
摘要
大语言模型(LLMs)在预训练过程中会学习不希望的属性,包括危险知识和有毒文本生成。正如后训练使用不同的目标塑造不同的行为,我们认为,不学习方法应为所涉及的语言功能而设计。为研究此问题,我们考虑两种机制上不同的不学习目标:危险知识不学习和有毒性不学习。对于危险知识,我们引入了基于余弦的、元学习的 RMU 变体。对于有毒性,我们提出了基于层特定探针方向的多层目标。在四个开源 7-8B 参数模型上,我们的方法在两种类型不学习任务中均取得强劲结果,基于不同的训练目标。总体而言,我们的结果表明,不学习应作为一类问题来研究,类似于 LLM 后训练的多种类型。
引用
@article{arxiv.2605.26454,
title = {Model Unlearning Objectives Vary for Distinct Language Functions},
author = {Berk Atil and Vipul Gupta and Rebecca J. Passonneau},
journal= {arXiv preprint arXiv:2605.26454},
year = {2026}
}