中文

微调后模型编辑的鲁棒性?——面向文本到图像扩散模型的实证研究

人工智能 2025-06-24 v1 机器学习

摘要

模型编辑提供了一种低成本的方式,可在不进行大规模再训练的情况下注入或纠正特定行为,支持事实纠正和偏见缓解等应用。尽管存在这种常规做法,却仍不清楚编辑在微调后是否持久存在,或者是否会被意外地反转。这一问题具有根本性的实用意义。例如,如果微调会移除先前的编辑,则可作为隐藏恶意编辑的防御机制。反之,意外移除与偏见缓解相关的编辑可能引发严重的安全问题。我们系统地研究了模型编辑和微调在文本到图像扩散模型(T2I diffusion models)中的相互作用,这类模型已知存在偏见并生成不当内容。我们的研究涵盖两个T2I模型系列(Stable Diffusion 和 FLUX)、两种最先进的编辑技术以及三种微调方法(DreamBooth、LoRA 和 DoRA)。通过对各种编辑任务和评估指标的广泛实证分析,我们的发现表明:编辑通常会在微调后失败,即使微调与编辑无关或仅 tangential。值得注意的是,我们观察到DoRA exhibits the strongest edit reversal effect。与此同时,在编辑方法方面,UCE 显示出更大的鲁棒性,微调后仍显著高于ReFACT保持更高的效能。这些发现揭示了当前编辑方法的关键局限,强调需要更健壮的技术来确保已部署AI系统的可靠长期控制和对齐。这些发现对AI安全具有双重意义:它们表明微调可作为恶意编辑的修复机制,同时突显了在微调后重新编辑以维持有益的安全和对齐属性的必要性。

关键词

引用

@article{arxiv.2506.18428,
  title  = {How Robust is Model Editing after Fine-Tuning? An Empirical Study on Text-to-Image Diffusion Models},
  author = {Feng He and Zhenyang Liu and Marco Valentino and Zhixue Zhao},
  journal= {arXiv preprint arXiv:2506.18428},
  year   = {2025}
}