一种基于语义辅助并采用计划采样的视频字幕生成模型
计算机视觉与模式识别
2021-02-15 v3 计算与语言
摘要
给定视频特征,循环神经网络可用于自动生成视频字幕。现有视频字幕方法至少有三点局限。首先,语义信息已被广泛用于提升视频字幕模型性能,但现有网络常无法提供有意义的语义特征。其次,教师强制(Teacher Forcing)算法常用于优化视频字幕模型,但训练与推理阶段引导词生成策略不同,导致性能不佳。第三,当前视频字幕模型易生成较短且不当表达视频内容的字幕。为解决这三个问题,我们提出三项相应改进。首先,提出一种度量以比较语义特征质量,并选用适当特征作为语义检测网络(SDN)输入,该网络复杂度适中,可为视频生成有意义的语义特征。随后,应用计划采样(scheduled sampling)策略,将训练阶段由教师引导逐步转向自主教学。最后,以句长加权常规对数概率损失函数,缓解生成短句的倾向。我们的模型在YouTube2Text数据集上优于先前模型,在MSR-VTT数据集上与先前最优模型相当。
引用
@article{arxiv.1909.00121,
title = {A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling},
author = {Haoran Chen and Ke Lin and Alexander Maye and Jianming Li and Xiaolin Hu},
journal= {arXiv preprint arXiv:1909.00121},
year = {2021}
}
备注
11 pages