用于视频描述的分层边界感知神经编码器
计算机视觉与模式识别
2018-11-26 v3
摘要
使用循环神经网络进行视频描述最近引起了广泛关注,因为它们既可以用来编码输入视频,也可以用来生成相应的描述。在本文中,我们提出了一种循环视频编码方案,该方案能够发现并利用视频的分层结构。与经典编码器-解码器方法中视频由循环层连续编码不同,我们提出了一种新颖的 LSTM 单元,该单元能够识别帧或片段之间的不连续点,并相应地修改编码层的时间连接。我们在三个大规模数据集上评估了我们的方法:Montreal Video Annotation 数据集、MPII Movie Description 数据集和 Microsoft Video Description Corpus。实验表明,我们的方法能够发现输入视频的适当分层表示,并在电影描述数据集上改进了现有技术的结果。
引用
@article{arxiv.1611.09312,
title = {Hierarchical Boundary-Aware Neural Encoder for Video Captioning},
author = {Lorenzo Baraldi and Costantino Grana and Rita Cucchiara},
journal= {arXiv preprint arXiv:1611.09312},
year = {2018}
}
备注
CVPR 2017