面向视频抽象式摘要的摘要价值视觉表征学习
计算与语言
2023-05-09 v1
摘要
视频的多模态抽象式摘要(MAS)需要根据多模态资源(在本研究中为视频内容及其转录文本)生成简洁的文本摘要以描述视频亮点。受大规模生成式预训练语言模型(GPLM)在生成高质量文本内容(如摘要)方面成功的启发,近期 MAS 方法提出通过为 GPLM 配备视觉信息(通常由通用视觉特征提取器获得)来使其适配该任务。然而,通用提取的视觉特征可能忽略某些具有摘要价值的视觉信息,从而阻碍模型性能。本工作中,我们提出一种新颖方法,学习有助于抽象式摘要的摘要价值视觉表征。我们的方法从跨模态转录文本数据以及从伪摘要中蒸馏的知识两方面利用摘要价值信息。在三个公开多模态数据集上的大量实验表明,我们的方法优于所有对比基线。此外,借助摘要价值视觉信息的优势,我们的模型在小型数据集甚至训练数据有限的数据集上均能取得显著提升。
引用
@article{arxiv.2305.04824,
title = {Learning Summary-Worthy Visual Representation for Abstractive Summarization in Video},
author = {Zenan Xu and Xiaojun Meng and Yasheng Wang and Qinliang Su and Zexuan Qiu and Xin Jiang and Qun Liu},
journal= {arXiv preprint arXiv:2305.04824},
year = {2023}
}
备注
Accepted by IJCAI-2023