中文

归因分析结合模型编辑:通过 VisEdit 推进视觉语言模型中的知识修正

计算机视觉与模式识别 2025-01-24 v3 计算与语言

摘要

模型编辑旨在无需昂贵重新训练的情况下纠正大型模型中的过时或错误知识。近期研究发现,提示中主体的最终标记在中间层表示具有对事实预测的强烈影响,并基于此观察开发了大型语言模型(LLM)编辑技术。然而,对于视觉-LLM(VLLM),视觉表示如何影响仅解码器语言模型的预测在很大程度上尚未被探索。据我们所知,VLLM 的模型编辑在文献中尚未被广泛研究。在这项工作中,我们采用贡献分配和噪声扰动方法来测量视觉表示对标记预测的贡献。我们的归因分析表明,与提示高度相关的中到后期层中的视觉表示对预测有显著贡献。基于这些见解,我们提出了 VisEdit,一种用于 VLLM 的新型模型编辑器,通过编辑与编辑提示相关区域中的中间视觉表示来有效修正知识。我们使用多个 VLLM 骨干网络和公开的 VLLM 编辑基准数据集评估了 VisEdit。结果表明 VisEdit 优于从现有 LLM 编辑器适配的强基线。

关键词

引用

@article{arxiv.2408.09916,
  title  = {Attribution Analysis Meets Model Editing: Advancing Knowledge Correction in Vision Language Models with VisEdit},
  author = {Qizhou Chen and Taolin Zhang and Chengyu Wang and Xiaofeng He and Dakan Wang and Tingting Liu},
  journal= {arXiv preprint arXiv:2408.09916},
  year   = {2025}
}

备注

Accepted to AAAI-2025 as an oral presentation