面向过程式多模态机器理解的时序-模态实体图建模
计算与语言
2022-04-07 v1 多媒体
摘要
过程式多模态文档(PMD)逐步组织文本指令与对应图像。理解PMD并推导其表示以用于下游推理任务被称为过程式多模态机器理解(M3C)。在本研究中,我们在细粒度层面(相较于现有在文档或句子层面的探索)即实体层面处理过程式M3C。经细致考量,我们对实体的时序与跨模态关系进行建模,并提出一种新颖的时序-模态实体图(TMEG)。具体而言,图结构被构建以捕获文本与视觉实体并追踪其时序-模态演化。此外,引入图聚合模块进行图编码与推理。我们在传统数据集RecipeQA和我们的新数据集CraftQA上针对三个过程式M3C任务开展了全面实验,后者能更好地评估TMEG的泛化能力。
引用
@article{arxiv.2204.02566,
title = {Modeling Temporal-Modal Entity Graph for Procedural Multimodal Machine Comprehension},
author = {Huibin Zhang and Zhengkun Zhang and Yao Zhang and Jun Wang and Yufan Li and Ning jiang and Xin wei and Zhenglu Yang},
journal= {arXiv preprint arXiv:2204.02566},
year = {2022}
}
备注
Accepted by ACL-2022