RAZOR:面向视觉 Transformer 和扩散模型的比例感知图层编辑以实现目标化学习
计算机视觉与模式识别
2026-03-17 v1 人工智能
摘要
Transformer 架构的扩散模型和视觉语言模型取得了显著进展;然而,如何在不重新训练的情况下高效地删除不希望或敏感信息,仍是模型安全与合规的核心挑战。我们引入了比例感知零/一步优化保留式化学习 (RAZOR),一种轻量级、模型无关的化学习框架,其将保留更新推广到 Transformer 主干网络中的协调多层和多头编辑。RAZOR 通过衡量各层和注意力头对删除目标数据贡献的多少,从而识别最重要的层和注意力头,以保留有用知识。随后,使用精心正则化的规则更新这些模型部分,以避免损害整体性能。编辑组件集合逐渐增长,确保在不过度编辑或损害无关能力的情况下实现精准化学习。我们在 CLIP、Stable Diffusion 和视觉语言模型 (VLM) 上评估了 RAZOR,采用广泛采用的化学习基准测试涵盖身份、风格和对象擦除任务。我们的结果表明,RAZOR 即使在量化情况下也实现高度精确且稳定的化学习。该方法优于先前方法,实现更强的保留与更好的效率。值得注意的是,它还显著快于传统技术。这些结果表明,RAZOR 是一种实用且可扩展的面向 Transformer 基础视觉模型的安全、可适应化化学习解决方案。
关键词
引用
@article{arxiv.2603.14819,
title = {RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Models},
author = {Ravi Ranjan and Utkarsh Grover and Xiaomin Lin and Agoritsa Polyzou},
journal= {arXiv preprint arXiv:2603.14819},
year = {2026}
}
备注
18 pages, 6 figures, 8 tables, accepted to the CVPR 2026 and to appear in the Findings Track Proceedings of IEEE/CVF Conference