中文

面向多模态大语言模型的视觉导向细粒度知识编辑

计算机视觉与模式识别 2024-11-21 v1 人工智能

摘要

知识编辑旨在高效且低成本地纠正不准确信息并更新过时信息。近期,将知识编辑从大语言模型 (LLM) 扩展至多模态大语言模型 (MLLM) 受到日益关注,后者融合了文本与视觉信息,引入了额外的编辑复杂性。现有的多模态知识编辑工作主要聚焦于文本导向的粗粒度场景,未能应对多模态上下文带来的独特挑战。在本文中,我们提出一项视觉导向的细粒度多模态知识编辑任务,旨在对具有多个交互实体的图像进行精确编辑。我们引入细粒度视觉知识编辑 (FGVEdit) 基准来评估该任务。此外,我们提出基于多模态范围分类器的知识编辑器 (MSCKE) 框架。MSCKE 利用一个融合视觉与文本信息的多模态范围分类器,以准确识别并更新图像中与特定实体相关的知识。该方法确保了精确编辑的同时保留无关信息,克服了传统纯文本编辑方法的局限性。在 FGVEdit 基准上的大量实验表明,MSCKE 优于现有方法,展示了其在解决多模态知识编辑复杂挑战方面的有效性。

关键词

引用

@article{arxiv.2411.12790,
  title  = {Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models},
  author = {Zhen Zeng and Leijiang Gu and Xun Yang and Zhangling Duan and Zenglin Shi and Meng Wang},
  journal= {arXiv preprint arXiv:2411.12790},
  year   = {2024}
}