学习在什么地方编辑视觉 Transformer
计算机视觉与模式识别
2024-11-05 v1
摘要
模型编辑旨在数据效率地纠正大型预训练模型的预测错误,同时确保对邻近失效的泛化以及最小化对无关示例的副作用。虽然在编辑基于 Transformer 的大型语言模型方面取得了显著进展,但针对计算机视觉中视觉 Transformer (ViT) 的有效策略仍 largely 未被探索。本文初步步骤纠正 ViT 的预测错误,尤其是源于亚群体迁移的错误。采用定位后编辑的方法,我们首先通过元学习在 CutMix 增强数据上训练超网络,以解决编辑可靠性的“在何处编辑”问题。该训练好的超网络产生可泛化的二值掩码,标识稀疏子集结构模型参数,对真实世界的失败样本作出响应。随后,我们通过对已识别参数进行微调(使用变体的梯度下降)以实现成功的编辑。为验证我们的方法,我们构建了一个编辑基准,引入亚群体迁移向自然欠代表性图像和人工生成图像,以揭示预训练 ViT 在对象识别中的局限性。我们的方法不仅在所提出的基准上表现优异,还允许在泛化性和局部性之间进行可调的权衡。我们的代码可在 https://github.com/hustyyq/Where-to-Edit 查阅。
关键词
引用
@article{arxiv.2411.01948,
title = {Learning Where to Edit Vision Transformers},
author = {Yunqiao Yang and Long-Kai Huang and Shengzhuang Chen and Kede Ma and Ying Wei},
journal= {arXiv preprint arXiv:2411.01948},
year = {2024}
}