用于改进视觉字幕生成的融合模型
计算机视觉与模式识别
2021-03-01 v2 人工智能
计算与语言
机器学习
摘要
视觉字幕生成旨在给定图像或视频时生成文本描述。传统上,图像字幕模型在人工标注的数据集(如Flickr30k和MS-COCO)上训练,这些数据集在规模与多样性上有限。该限制阻碍了这些模型的泛化能力,同时也使它们容易出错。然而,语言模型可在大量免费可用的无标注数据上训练,并近期作为成功的语言编码器与连贯文本生成器崭露头角。同时,若干单模态与多模态融合技术已被证明对自然语言生成与自动语音识别效果良好。基于这些近期进展,并以提升生成字幕质量为目标,本文工作的贡献有二:首先,我们提出一个通用的多模态模型融合框架用于字幕生成与修正,利用不同融合策略将预训练的辅助语言模型(AuxLM)整合进传统的编码器-解码器视觉字幕框架。其次,我们采用相同融合策略将预训练的掩码语言模型(MLM)即BERT与视觉字幕模型(即Show, Attend, and Tell)整合,以修正字幕中的句法与语义错误。我们在三个基准图像字幕数据集(即Flickr8k、Flickr30k和MSCOCO)上的字幕修正实验显示出相对于基线的提升,表明我们所提多模态融合策略的有效性。此外,我们对修正后字幕进行了初步定性分析,并基于纠错类型划分了错误类别。
引用
@article{arxiv.2010.15251,
title = {Fusion Models for Improved Visual Captioning},
author = {Marimuthu Kalimuthu and Aditya Mogadala and Marius Mosbach and Dietrich Klakow},
journal= {arXiv preprint arXiv:2010.15251},
year = {2021}
}
备注
Accepted at "Multi-Modal Deep Learning: Challenges and Applications" (MMDLCA), International Conference on Pattern Recognition (ICPR)-2020, Milano, Italia