中文

深度多核卷积 LSTM 网络及一种面向视频的注意力机制

计算机视觉与模式识别 2019-08-27 v1 机器学习 机器学习

摘要

动作识别极大受益于视频分析中的运动理解。诸如长短期记忆(LSTM)网络等循环网络是运动感知序列学习任务的热门选择。近来,有人提出 LSTM 的卷积扩展,其中输入到隐藏和隐藏到隐藏的转移通过单一核的卷积建模。这意味着效率与效果之间不可避免的权衡。在此,我们提出对卷积 LSTM 网络的一种新增强,支持容纳多个卷积核与层。这类似于一种 Network-in-LSTM 方法,改善了上述顾虑。此外,我们提出一种专为多核扩展设计的基于注意力的机制。我们在 UCF-101 和 Sports-1M 数据集上的监督分类设定中评估了所提扩展,结果表明我们的增强提升了准确率。我们还进行了定性分析以揭示我们的系统与卷积 LSTM 基线的特性。

关键词

引用

@article{arxiv.1908.08990,
  title  = {Deep Multi-Kernel Convolutional LSTM Networks and an Attention-Based Mechanism for Videos},
  author = {Sebastian Agethen and Winston H. Hsu},
  journal= {arXiv preprint arXiv:1908.08990},
  year   = {2019}
}