压缩视频中的视频字幕生成
计算机视觉与模式识别
2021-01-05 v1
摘要
现有的视频字幕生成方法集中于探索未压缩视频中的全局帧特征,而压缩视频中已编码的免费且关键的显著性信息通常被忽视。我们提出了一种直接对存储的压缩视频进行操作的视频字幕生成方法。为学习用于视频字幕生成的判别性视觉表示,我们设计了一个残差辅助编码器(RAE),其在残差帧的辅助下定位I帧中的感兴趣区域。首先,我们通过提取残差特征作为I帧中每个位置的显著性值来获得空间注意力权重,并设计空间注意力模块以细化注意力权重。我们进一步提出一个时间门模块来决定被关注特征对字幕生成的贡献程度,使模型能够抵抗压缩视频中某些噪声信号的干扰。最后,利用长短期记忆(Long Short-Term Memory)将视觉表示解码为描述。我们在两个基准数据集上评估了我们的方法,并证明了方法的有效性。
引用
@article{arxiv.2101.00359,
title = {Video Captioning in Compressed Video},
author = {Mingjian Zhu and Chenrui Duan and Changbin Yu},
journal= {arXiv preprint arXiv:2101.00359},
year = {2021}
}