并非所有词皆平等:面向视频描述任务的视频特定信息损失
计算机视觉与模式识别
2019-01-03 v1
摘要
对于给定视频的理想描述应当聚焦于显著且具有代表性的内容,从而能够将该视频与其他视频区分开来。然而,在视频描述数据集中不同词的分布是不均衡的,其中用于描述视频特定显著物体的区别性词语远少于“a”“the”“person”等常见词。这种数据集偏差常导致对显著但罕见物体的识别错误 or 细节缺失。为解决此问题,我们提出一种称为信息损失(Information Loss)的新型学习策略,其关注视频特定视觉内容与相应代表性词语之间的关系。此外,我们建立了一个具有分层视觉表示和优化分层注意力机制的框架,以捕获最显著的空间-时间视觉信息,从而充分发挥所提学习策略的潜在优势。大量实验表明,这一巧妙的引导策略与优化架构相结合在 MSVD 上以 CIDEr 分数 87.5 优于当前最优的视频描述方法,并在 MSR-VTT 上取得 47.7 的优越 CIDEr 分数。我们还表明,我们的信息损失具有通用性,可显著提升多种模型的性能。
引用
@article{arxiv.1901.00097,
title = {Not All Words are Equal: Video-specific Information Loss for Video Captioning},
author = {Jiarong Dong and Ke Gao and Xiaokai Chen and Junbo Guo and Juan Cao and Yongdong Zhang},
journal= {arXiv preprint arXiv:1901.00097},
year = {2019}
}
备注
BMVC2018 accepted