中文

面向多模态摘要的分层跨模态语义关联学习模型

计算机视觉与模式识别 2021-12-23 v1 人工智能 计算与语言

摘要

多模态输出多模态摘要(MSMO)生成包含文本与视觉内容的摘要。多模态新闻报道包含异构内容,这使得MSMO并非易事。此外,观察到新闻报道中不同模态的数据呈分层关联。传统MSMO方法通过为整体数据学习一个表示来无差别地处理不同模态数据,无法直接适应异构内容与分层关联。本文提出一种分层跨模态语义关联学习模型(HCSCL),以学习多模态数据中存在的模态内与模态间关联。HCSCL采用图网络编码模态内关联。随后,提出一种分层融合框架以学习文本与图像间的分层关联。此外,我们构建了一个带有相关图像标注与图像对象标签信息的新数据集,为学习过程提供监督信息。在该数据集上的大量实验表明,HCSCL在自动摘要指标与细粒度多样性测试中显著优于基线方法。

关键词

引用

@article{arxiv.2112.12072,
  title  = {Hierarchical Cross-Modality Semantic Correlation Learning Model for Multimodal Summarization},
  author = {Litian Zhang and Xiaoming Zhang and Junshu Pan and Feiran Huang},
  journal= {arXiv preprint arXiv:2112.12072},
  year   = {2021}
}

备注

Accepted by AAAI2022