M-MRE:将相互强化效应扩展到多模态信息抽取
计算与语言
2025-06-13 v2 计算机视觉与模式识别
多媒体
摘要
相互强化效应(MRE)是信息抽取与模型可解释性交叉领域的新兴子领域。MRE旨在通过联合建模,利用不同粒度任务之间的相互理解,提高粗粒度和细粒度任务的性能。虽然MRE在文本领域已得到探索和验证,但其在视觉和多模态领域的适用性尚未探讨。本文首次将MRE扩展到多模态信息抽取领域。具体而言,我们引入了新任务:多模态相互强化效应(M-MRE),并构建了支持该任务的数据集。为应对M-MRE带来的挑战,我们进一步提出了兼容各种大型视觉语言模型(LVLMs)的提示格式适配器(PFA)。实验结果表明,MRE在M-MRE任务中亦可观察到,表明其在多模态文本-图像理解场景中确实存在。为证明其普遍适用性,本文提供了MRE超越文本领域的强有力证据,确认其在三个相互关联任务中的互利增益。
引用
@article{arxiv.2504.17353,
title = {M-MRE: Extending the Mutual Reinforcement Effect to Multimodal Information Extraction},
author = {Chengguang Gan and Zhixi Cai and Yanbin Wei and Yunhao Liang and Shiwen Ni and Tatsunori Mori},
journal= {arXiv preprint arXiv:2504.17353},
year = {2025}
}