中文

揭示并缓解多模态模型编辑中的暂时性失明现象

机器学习 2025-11-18 v1 人工智能 计算机视觉与模式识别

摘要

多模态模型编辑(MMED)旨在纠正多模态模型中的错误知识。现有评估方法借鉴自文本模型编辑,低估了成功率,因其依赖于低相似度或随机输入,掩盖了过拟合问题。我们提出了完善的局部评估框架,涵盖三个关键维度:随机图像局部性、无图像局部性和一致性图像局部性,通过七种不同的数据类型实现,对多模态编辑进行细致且结构化的分析。我们引入De-VQA,一种用于视觉问答的动态评估,揭示了我们称之为暂时性失明的现象,即模型对编辑相似的文本过拟合,忽略视觉信息。标记分析显示,编辑主要影响文本标记。我们提出了基于局部性的对抗损失,以平衡跨模态表示。实证结果表明,我们的方法在所有基线上均表现出色,显著降低了暂时性失明现象,并在平均情况下提高了17%的局部性。

关键词

引用

@article{arxiv.2511.13243,
  title  = {Uncovering and Mitigating Transient Blindness in Multimodal Model Editing},
  author = {Xiaoqi Han and Ru Li and Ran Yi and Hongye Tan and Zhuomin Liang and Víctor Gutiérrez-Basulto and Jeff Z. Pan},
  journal= {arXiv preprint arXiv:2511.13243},
  year   = {2025}
}

备注

Accepted at AAAI'26