中文

MPMQA:面向产品说明书的多模态问答

计算与语言 2023-04-20 v1

摘要

插图与图像等视觉内容在产品说明书理解中起着重要作用。现有的产品说明书问答(PMQA)数据集往往忽略视觉内容而仅保留文本部分。本工作中,为强调多模态内容的重要性,我们提出多模态产品说明书问答(MPMQA)任务。对于每个问题,MPMQA要求模型不仅处理多模态内容,还提供多模态答案。为支持MPMQA,我们构建了带有人类标注的大规模数据集PM209,其包含来自27个知名消费电子品牌的209份产品说明书。人类标注包括说明书内容的6类语义区域及22,021对问答。特别地,每个答案由一句文本及说明书中相关的视觉区域组成。考虑到产品说明书的长度以及问题总与少数页面相关这一事实,MPMQA可自然拆分为两个子任务:检索最相关页面,然后生成多模态答案。我们进一步提出一个统一模型,可一并执行这两个子任务,并达到与多个任务专用模型相当的性能。PM209数据集可从 https://github.com/AIM3-RUC/MPMQA 获取。

关键词

引用

@article{arxiv.2304.09660,
  title  = {MPMQA: Multimodal Question Answering on Product Manuals},
  author = {Liang Zhang and Anwen Hu and Jing Zhang and Shuo Hu and Qin Jin},
  journal= {arXiv preprint arXiv:2304.09660},
  year   = {2023}
}