中文

M-MRE:将相互强化效应扩展到多模态信息抽取

计算与语言 2025-06-13 v2 计算机视觉与模式识别 多媒体

摘要

相互强化效应(MRE)是信息抽取与模型可解释性交叉领域的新兴子领域。MRE旨在通过联合建模,利用不同粒度任务之间的相互理解,提高粗粒度和细粒度任务的性能。虽然MRE在文本领域已得到探索和验证,但其在视觉和多模态领域的适用性尚未探讨。本文首次将MRE扩展到多模态信息抽取领域。具体而言,我们引入了新任务:多模态相互强化效应(M-MRE),并构建了支持该任务的数据集。为应对M-MRE带来的挑战,我们进一步提出了兼容各种大型视觉语言模型(LVLMs)的提示格式适配器(PFA)。实验结果表明,MRE在M-MRE任务中亦可观察到,表明其在多模态文本-图像理解场景中确实存在。为证明其普遍适用性,本文提供了MRE超越文本领域的强有力证据,确认其在三个相互关联任务中的互利增益。

关键词

引用

@article{arxiv.2504.17353,
  title  = {M-MRE: Extending the Mutual Reinforcement Effect to Multimodal Information Extraction},
  author = {Chengguang Gan and Zhixi Cai and Yanbin Wei and Yunhao Liang and Shiwen Ni and Tatsunori Mori},
  journal= {arXiv preprint arXiv:2504.17353},
  year   = {2025}
}