基于特征对齐网络的视觉节奏预测
计算机视觉与模式识别
2019-01-30 v1
摘要
本文提出一种数据驱动的视觉节奏预测方法,克服了以往工作主要依赖人工设计的硬性规则进行预测的不足。在我们的方法中,首先提取包括原始帧及其残差、光流、场景变化和身体姿态在内的特征。这些视觉特征随后作为输入送入一个端到端神经网络。我们观察到特征在时间轴上存在轻微错位,并推测这是由于不同特征的计算方式存在差异所致。为解决该问题,提取的特征通过一个精心设计的层进行对齐,该层也可应用于其他受特征不匹配困扰的模型并提升性能。接着,这些对齐后的特征被送入由 BiLSTM 和 CRF 实现的序列标注层以预测起始点。由于缺乏现有的公开训练与评测集,我们在基于专业剪辑的音乐视频(MVs)自行构建的数据集上进行实验,本方法的 F1 分数达到 79.6。
引用
@article{arxiv.1901.10163,
title = {Visual Rhythm Prediction with Feature-Aligning Network},
author = {Yutong Xie and Haiyang Wang and Yan Hao and Zihao Xu},
journal= {arXiv preprint arXiv:1901.10163},
year = {2019}
}
备注
6 pages, 4 figures