基于最优传输对齐的语义一致跨域摘要方法
计算机视觉与模式识别
2022-10-11 v1
摘要
多模态输出多媒体摘要(MSMO)是语言 grounding 中一个近期被探索的应用,在现实应用中发挥着重要作用,例如为新闻文章自动生成封面图像与标题,或为在线视频提供简介。然而,现有方法从整个视频和文章中提取特征并使用融合方法选择代表性内容,因而通常忽略了关键结构与变化的语义。本工作中,我们提出一种基于最优传输对齐与视觉和文本分割的语义一致跨域摘要(SCCS)模型。具体而言,我们的方法首先将视频和文章分别分解为片段以捕捉结构语义;随后 SCCS 遵循一个带有最优传输距离的跨域对齐目标,利用多模态交互来匹配并选择视觉与文本摘要。我们在三个近期多模态数据集上评估了该方法,并证明了其在生成高质量多模态摘要方面的有效性。
引用
@article{arxiv.2210.04722,
title = {Semantics-Consistent Cross-domain Summarization via Optimal Transport Alignment},
author = {Jielin Qiu and Jiacheng Zhu and Mengdi Xu and Franck Dernoncourt and Trung Bui and Zhaowen Wang and Bo Li and Ding Zhao and Hailin Jin},
journal= {arXiv preprint arXiv:2210.04722},
year = {2022}
}