RMPL:面向多媒体事件抽取的关系感知多任务渐进学习与阶段训练
计算与语言
2026-05-28 v2 计算机视觉与模式识别
摘要
多媒体事件抽取(MEE)旨在从包含文本和图像的文档中识别事件及其论元,需要在不同模态之间对事件语义进行锚定。MEE 的进展受限于缺乏标注训练数据的不足。M2E2 是唯一确立的基准,但仅提供评估标注,使得直接监督训练难以实现。现有方法主要依赖跨模态对齐或基于视觉-语言模型(VLM)的推理时提示,这些方法未显式学习结构化事件表示,常在多模态环境中产生弱论元锚定。为此,本文提出 RMPL,即面向 MEE 的关系感知多任务渐进学习框架,在低资源条件下实现目标。RMPL 融合来自单模态事件抽取和多媒体关系抽取的异构监督信号,通过阶段化训练实现。该模型首先以统一模式学习跨模态的事件中心表示,然后使用混合文本和视觉数据进行事件提及识别和论元角色抽取微调。在多个视觉-语言模型下,对 M2E2 基准进行实验,结果在不同模态设置下均实现一致改进。
引用
@article{arxiv.2602.13748,
title = {RMPL: Relation-aware Multi-task Progressive Learning with Stage-wise Training for Multimedia Event Extraction},
author = {Yongkang Jin and Jianwen Luo and Jingjing Wang and Jianmin Yao and Yu Hong},
journal= {arXiv preprint arXiv:2602.13748},
year = {2026}
}
备注
Accepted by ACM ICMR 2026