MC-MKE: 一个强调模态一致性的细粒度多模态知识编辑基准
计算机视觉与模式识别
2024-10-31 v2 计算与语言
摘要
多模态大语言模型(MLLM)容易出现非事实性或过时的知识问题,这些问题可能表现为由于多模态知识的复杂性而导致的误读和误识别错误。以往的基准测试未能系统分析编辑方法在纠正这两种错误类型方面的性能。为了更好地表示和纠正这些错误,我们将多模态知识分解为其视觉和文本组成部分。不同的错误类型对应不同的编辑格式,这些格式编辑多模态知识的不同部分。我们提出了MC-MKE,一个强调模态一致性的细粒度多模态知识编辑基准。我们的基准通过编辑相应的知识组件,促进了对误读和误识别错误的独立纠正。我们在MC-MKE上评估了四种多模态知识编辑方法,揭示了它们的局限性,特别是在模态一致性方面。我们的工作突出了多模态知识编辑带来的挑战,并激励了为这项任务开发有效技术的进一步研究。
引用
@article{arxiv.2406.13219,
title = {MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency},
author = {Junzhe Zhang and Huixuan Zhang and Xunjian Yin and Baizhou Huang and Xu Zhang and Xinyu Hu and Xiaojun Wan},
journal= {arXiv preprint arXiv:2406.13219},
year = {2024}
}