基于大规模真实数据集多模态深度学习的细粒度视频吸引力预测
计算机视觉与模式识别
2018-04-10 v2
摘要
如今,数十亿视频在线可供观看与分享。在海量视频中,一些热门视频被在线用户广泛观看,而大多数鲜有人关注。此外,在每个视频内部,不同片段可能吸引显著不同的观看次数。这一现象导致了一个具挑战性却重要的问题,即细粒度视频吸引力预测。然而,此类挑战性问题的一大障碍是当前缺乏合适的基准数据集。为此,我们构建了首个细粒度视频吸引力数据集,其采集自全球最热门视频网站之一。总体而言,所构建的 FVAD 包含 1,019 集电视剧,时长 780.6 小时,覆盖不同类别与广泛视频内容。除大量视频外,还包含数亿条观看过程中的用户行为,如“观看次数”、“快进”、“快退”等,其中“观看次数”反映视频吸引力,而其他互动捕捉观众与视频间的交互。首先,我们证明视频吸引力与不同互动呈现不同关系。其次,FVAD 为我们研究细粒度视频吸引力预测问题提供契机。我们设计了不同的序列模型,仅依靠视频内容进行视频吸引力预测。这些序列模型在不同层次上利用了视频内容中视觉与音频组件间的多模态关系。实验结果证明了我们所提具有不同视觉与音频表示的序列模型的有效性、融合两种模态的必要性,以及序列预测模型在不同层次上的互补行为。
引用
@article{arxiv.1804.01373,
title = {Fine-grained Video Attractiveness Prediction Using Multimodal Deep Learning on a Large Real-world Dataset},
author = {Xinpeng Chen and Jingyuan Chen and Lin Ma and Jian Yao and Wei Liu and Jiebo Luo and Tong Zhang},
journal= {arXiv preprint arXiv:1804.01373},
year = {2018}
}
备注
Accepted by WWW 2018 The Big Web Track