用于视频字幕生成的帧级与片段级特征及候选池评估
计算机视觉与模式识别
2016-08-18 v1
摘要
我们提交了参加微软视频到语言挑战赛的作品,旨在为挑战赛数据集中的视频生成简短描述字幕。我们的模型基于编码器 - 解码器流程,这在图像和视频字幕系统中非常流行。我们提出利用两种不同类型的视频特征:一种用于捕捉视频中的物体和属性内容,另一种用于捕捉运动和动作信息。利用这些多样化的特征,我们训练了专注于两个独立输入子领域的模型。随后,我们训练了一个评估器模型,用于从这些领域专家模型生成的候选字幕池中挑选最佳字幕。我们认为,由于数据集的多样性,与使用单一模型相比,这种方法更适合当前的视频字幕任务。我们的方法有效性得到了证实:根据人工评估,它在 MSR 视频到语言挑战赛中被评为最佳;此外,我们在基于自动评估指标的排行榜上位列第二。
引用
@article{arxiv.1608.04959,
title = {Frame- and Segment-Level Features and Candidate Pool Evaluation for Video Caption Generation},
author = {Rakshith Shetty and Jorma Laaksonen},
journal= {arXiv preprint arXiv:1608.04959},
year = {2016}
}