中文

面向统一多模态编辑的增强知识协作

计算机视觉与模式识别 2024-11-01 v3

摘要

多模态LLMs(MLLMs)的快速发展也为有效知识编辑带来了重大挑战。当前方法,包括内在知识编辑和外部知识依赖,各自具有优势和不足,难以在应用于MLLMs时平衡所需的可靠性、通用性和局部性。本文提出UniKE,这是一种新型多模态编辑方法,通过建立内在知识编辑和外部知识依赖的统一视角和范式。将两种类型的知识概念化为向量化的键值记忆,相应的编辑过程类似于人类认知中的同化和适应阶段,在相同的语义水平上进行。就该统一框架而言,我们进一步通过将知识表示解耦为语义空间和真实性空间来促进知识协作。广泛的实验验证了该方法的有效性,确保了编辑后的MLLMs同时保持出色的可靠性、通用性和局部性。UniKE的代码可在\url{https://github.com/beepkh/UniKE}获取。

关键词

引用

@article{arxiv.2409.19872,
  title  = {Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration},
  author = {Kaihang Pan and Zhaoyu Fan and Juncheng Li and Qifan Yu and Hao Fei and Siliang Tang and Richang Hong and Hanwang Zhang and Qianru Sun},
  journal= {arXiv preprint arXiv:2409.19872},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024 (Spotlight)