中文

DualEdit:用于视觉语言模型知识更新的双模态编辑

计算机视觉与模式识别 2025-09-22 v2 人工智能

摘要

模型编辑旨在无需耗时的完整重新训练即可更新预训练模型的知识。虽然现有初创性编辑方法取得了令人满意的结果, 但它们主要专注于编辑单模态语言模型(LLM)。然而, 对于涉及多种模态的视觉语言模型(VLM), 每种模态在编辑性能中的作用和影响尚未得到充分探索。为填补这一空白, 我们探讨了文本和视觉模态对模型编辑的影响, 并发现: (1) 文本和视觉表征在不同层数上达到峰值灵敏度, 反映了它们的不同重要性; ( (2) 编辑两种模态可以高效更新知识, 但会以牺牲模型原始能力为代价。基于我们的发现, 我们提出了DualEdit, 一个修改两个模态在各自关键层上的编辑器。此外, 我们在更敏感的文本模态中引入一个门控模块, 使DualEdit能够在保持模型原始信息的同时, 高效更新新知识。我们在多个VLM主干模型和基准数据集上评估了DualEdit, 在不同评估指标上均显示出优于最先进的VLM编辑基线以及经过适配的LLM编辑方法的优势。代码已公开于https://github.com/zhiyiscs/DualEdit

关键词

引用

@article{arxiv.2506.13638,
  title  = {DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models},
  author = {Zhiyi Shi and Binjie Wang and Chongjie Si and Yichen Wu and Junsik Kim and Hanspeter Pfister},
  journal= {arXiv preprint arXiv:2506.13638},
  year   = {2025}
}

备注

COLM 2025