ComprehendEdit:多模态知识编辑的综合数据集与评估框架
计算机视觉与模式识别
2024-12-18 v1
摘要
大型多模态语言模型(MLLM)彻底改变了自然语言处理和视觉理解,但通常包含过时或不准确的信息。当前的多模态知识编辑评估在范围上有限且可能存在偏差,侧重于狭窄的任务,未能评估对域内样本的影响。为解决这些问题,我们引入了ComprehendEdit,一个包含来自多个数据集的八种不同任务的综合基准。我们提出了两个新指标:知识泛化指数(KGI)和知识保留指数(KPI),它们在不依赖AI合成样本的情况下评估对域内样本的编辑效果。基于我们框架的见解,我们建立了层次化上下文编辑(HICE),一种采用两阶段方法的基础方法,可在所有指标上平衡性能。本研究为多模态知识编辑提供了更全面的评估框架,揭示了该领域的独特挑战,并提供了一种展示改进性能的基础方法。我们的工作为未来研究开辟了新视角,并为开发更鲁棒和有效的MLLM编辑技术奠定了基础。ComprehendEdit基准和实现代码可在https://github.com/yaohui120/ComprehendEdit获取。
引用
@article{arxiv.2412.12821,
title = {ComprehendEdit: A Comprehensive Dataset and Evaluation Framework for Multimodal Knowledge Editing},
author = {Yaohui Ma and Xiaopeng Hong and Shizhou Zhang and Huiyun Li and Zhilin Zhu and Wei Luo and Zhiheng Ma},
journal= {arXiv preprint arXiv:2412.12821},
year = {2024}
}
备注
Extended version for paper accepted to AAAI 2025. Project Page: https://github.com/yaohui120/ComprehendEdit