基于分层强化学习的视频字幕生成
计算机视觉与模式识别
2018-03-30 v3 人工智能
计算与语言
摘要
视频字幕生成是自动生成视频中动作文本描述的任务。尽管先前的工作(例如序列到序列模型)在抽取短视频的粗略描述方面已显示出有前景的结果,但对包含多个细粒度动作并带有详细描述视频进行字幕生成仍然非常具有挑战性。本文旨在通过提出一种新颖的用于视频字幕生成的分层强化学习框架来应对该挑战,其中一个高层Manager模块学习设计子目标,一个低层Worker模块识别基本动作以完成子目标。借助这一在不同层次上强化视频字幕生成的组合框架,我们的方法在一个新引入的用于细粒度视频字幕生成的大规模数据集上显著优于所有基线方法。此外,我们的非集成模型已经在广泛使用的MSR-VTT数据集上取得了最先进的结果。
引用
@article{arxiv.1711.11135,
title = {Video Captioning via Hierarchical Reinforcement Learning},
author = {Xin Wang and Wenhu Chen and Jiawei Wu and Yuan-Fang Wang and William Yang Wang},
journal= {arXiv preprint arXiv:1711.11135},
year = {2018}
}
备注
CVPR 2018, with supplementary material