复活您的 MNEME:通过稀疏模型差异预测 LLM 非学习及微调的副作用
计算与语言
2025-07-30 v1 机器学习
摘要
大型语言模型(LLM)频繁进行微调或非学习以适应新任务或消除不良行为。虽然现有评估方法在此类干预后评估性能,但仍缺乏一种通用方法来检测意外副作用,例如非学习生物学内容会损害化学任务的性能,尤其当这些效果是不可预测或涌现时。为此,我们引入了 MNEME(Model diffiNg for Evaluating Mechanistic Effects),一种用于识别这些副作用的轻量级框架,通过稀疏模型差异实现。MNEME 在不访问微调数据的情况下,对基座模型和微调后模型在任务中性数据(例如 The Pile、LMSYS-Chat-1M)上进行比较,以隔离行为变化。应用于五个 LLM及三种情景:WMDP 知识非学习、涌现性误差一致性、以及良性微调,MNEME 在预测副作用方面达到最高 95% 的准确率,与已知基准一致,且无需自定义启发式方法。 Furthermore,我们展示了在高激活样本上重新训练可以部分逆转这些效果。我们的结果表明,稀疏探测和差异提供了一种可扩展且自动化的视角,用于理解和管理 LLM 行为,为实际工具提供了实用方法。
引用
@article{arxiv.2507.21084,
title = {Reviving Your MNEME: Predicting The Side Effects of LLM Unlearning and Fine-Tuning via Sparse Model Diffing},
author = {Aly M. Kassem and Zhuan Shi and Negar Rostamzadeh and Golnoosh Farnadi},
journal= {arXiv preprint arXiv:2507.21084},
year = {2025}
}