MIKE:细粒度多模态实体知识编辑的新基准
计算与语言
2024-02-26 v1 人工智能
机器学习
摘要
多模态知识编辑代表了增强多模态大语言模型(MLLMs)能力的关键进步。尽管具有潜力,但当前的基准主要关注粗粒度知识,而细粒度(FG)多模态实体知识的复杂性在很大程度上未被探索。这一差距构成了显著挑战,因为FG实体识别对于MLLMs在各种实际场景中的实际部署和有效性至关重要。为弥补这一差距,我们引入了MIKE,一个专门为FG多模态实体知识编辑设计的综合基准和数据集。MIKE包含一套针对不同视角评估的任务,包括原始名称回答、实体级描述和复杂场景识别。此外,还引入了一种新的知识编辑形式——多步编辑,以评估编辑效率。通过广泛的评估,我们证明了当前最先进的方法在应对我们提出的基准时面临重大挑战,突显了MLLMs中FG知识编辑的复杂性。我们的发现强调了该领域对新方法的迫切需求,为社区未来的研究和开发工作设定了明确的议程。
引用
@article{arxiv.2402.14835,
title = {MIKE: A New Benchmark for Fine-grained Multimodal Entity Knowledge Editing},
author = {Jiaqi Li and Miaozeng Du and Chuanyi Zhang and Yongrui Chen and Nan Hu and Guilin Qi and Haiyun Jiang and Siyuan Cheng and Bozhong Tian},
journal= {arXiv preprint arXiv:2402.14835},
year = {2024}
}
备注
8 pages