基于边界感知分层语言解码与联合视频预测的视觉描述生成
计算机视觉与模式识别
2018-07-11 v1 计算与语言
摘要
互联网上视频数据的爆发需要有效且高效的技术,为无法观看视频的人自动生成描述。尽管视频描述生成研究取得了巨大进展,尤其在视频特征编码方面,语言解码器仍主要基于流行的 RNN 解码器如 LSTM,其倾向于偏好与视频对齐的高频词。本文提出一种用于视频描述生成的边界感知分层语言解码器,由一个高层基于 GRU 的语言解码器(作为全局(描述级)语言模型)和一个低层基于 GRU 的语言解码器(作为局部(短语级)语言模型)组成。最重要的是,我们在低层 GRU 语言解码器中引入一个二元门来检测语言边界。结合联合视频预测、共享软注意力和边界感知视频编码等其他先进组件,我们的集成视频描述生成框架能够发现分层语言信息并区分句子中的主语与宾语,而这在语言生成过程中常令人混淆。在 MSR-Video-to-Text (MSR-VTT) \cite{xu2016msr} 和 YouTube-to-Text (MSVD) \cite{chen2011collecting} 两个广泛使用的视频描述生成数据集上的大量实验表明,与最先进方法相比,我们的方法极具竞争力。
引用
@article{arxiv.1807.03658,
title = {Video Captioning with Boundary-aware Hierarchical Language Decoding and Joint Video Prediction},
author = {Xiangxi Shi and Jianfei Cai and Jiuxiang Gu and Shafiq Joty},
journal= {arXiv preprint arXiv:1807.03658},
year = {2018}
}