嫁接预训练模型用于多模态标题生成
计算机视觉与模式识别
2022-11-15 v1 人工智能
摘要
多模态标题利用视频帧与转录文本生成视频的自然语言标题。由于缺乏大规模人工标注数据,为视频标注有据标题的任务劳动密集且不切实际。先前关于预训练语言模型与视频-语言模型的研究已在相关下游任务上取得显著进展。然而,它们均无法直接应用于需要多模态编码器与句子解码器的多模态标题架构。简单拼接语言模型与视频-语言模型的一个主要挑战是模态平衡,旨在结合视觉-语言互补能力。本文中,我们提出一种新颖方法,将预训练视频-语言模型中的视频编码器嫁接到生成式预训练语言模型上。我们还提出一种通过模态间/模态内关系整合不同组件的共识融合机制。实证上,实验表明该嫁接模型在从真实世界应用收集的全新数据集上取得了强劲结果。
引用
@article{arxiv.2211.07210,
title = {Grafting Pre-trained Models for Multimodal Headline Generation},
author = {Lingfeng Qiao and Chen Wu and Ye Liu and Haoyuan Peng and Di Yin and Bo Ren},
journal= {arXiv preprint arXiv:2211.07210},
year = {2022}
}
备注
Accepted by EMNLP 2022