中文

基于多任务强化学习的端到端视频描述

计算机视觉与模式识别 2019-01-03 v2

摘要

尽管端到端(E2E)学习在各种视觉理解任务上取得了令人瞩目的进展,但它常常受到硬件限制(如 GPU 内存)的阻碍,且容易过拟合。在视频描述这一计算机视觉中最具挑战性的基准任务中,E2E 学习的这些局限性由于输入视频和输出描述均为长序列而被进一步放大。事实上,最先进的视频描述方法通过卷积神经网络处理视频帧,并通过展开循环神经网络生成描述。如果以 E2E 方式将它们连接起来,所得到的模型既消耗内存又极度依赖数据,使得训练极其困难。在本文中,我们提出了一种多任务强化学习方法来训练 E2E 视频描述模型。其主要思想是从人工描述的视频中挖掘并构建尽可能多的有效任务(如属性、奖励和描述),使得它们能够共同约束 E2E 神经网络的搜索空间,从中可以找到 E2E 视频描述模型并泛化到测试阶段。据我们所知,这是第一个从原始视频输入到描述输出进行端到端训练的视频描述模型。实验结果表明,该模型在两个基准视频描述数据集上以极大优势优于现有模型。

关键词

引用

@article{arxiv.1803.07950,
  title  = {End-to-End Video Captioning with Multitask Reinforcement Learning},
  author = {Lijun Li and Boqing Gong},
  journal= {arXiv preprint arXiv:1803.07950},
  year   = {2019}
}