MMKU-Bench: 面向多样化视觉知识的多模态更新基准测试
计算与语言
2026-03-17 v1
摘要
随着现实世界知识持续演变,多模态模型在预训练期间获得的参数化知识越来越难以与现实世界知识保持一致。现有的多模态知识更新研究只关注学习先前未知的知识,而忽视了更新模型已掌握但后来发生变化的知识的需求;此外,评估仅限于同一模态,缺乏对跨模态一致性的系统分析。为了解决这些问题,本文提出了MMKU-Bench,一个全面的多模态知识更新评估基准,包含超过25k个知识实例和49k多张图像,覆盖两种场景——已更新知识和未知知识,从而实现对不同知识类型学习的比较分析。在该基准上,我们评估了多种代表性方法,包括监督微调(SFT)、基于人类反馈的强化学习(RLHF)和知识编辑(KE)。实验结果表明,SFT和RLHF容易出现灾难性遗忘,而KE更好地保留了通用能力,但在持续更新方面存在明显局限。总体而言,MMKU-Bench为多模态知识更新提供了可靠且全面的评估基准,推动了该领域的进展。
引用
@article{arxiv.2603.15117,
title = {MMKU-Bench: A Multimodal Update Benchmark for Diverse Visual Knowledge},
author = {Baochen Fu and Yuntao Du and Cheng Chang and Baihao Jin and Wenzhi Deng and Muhao Xu and Hongmei Yan and Weiye Song and Yi Wan},
journal= {arXiv preprint arXiv:2603.15117},
year = {2026}
}