中文

AssembleNet:在视频架构中搜索多流神经连接

计算机视觉与模式识别 2020-05-28 v4 机器学习 神经与进化计算

摘要

学习表示视频在算法和计算上都是一项极具挑战性的任务。标准的视频 CNN 架构是通过直接将为图像理解设计的架构扩展到包含时间维度(使用如 3D 卷积等模块),或采用双流设计以捕获视频中的外观与运动来设计的。我们将视频 CNN 解释为相互连接的多流卷积块集合,并提出自动寻找具有更好连接性和时空交互的神经架构以用于视频理解的方法。这是通过以连接权重学习为指导,演化一群过度连接的架构来完成的。我们搜索结合在多个时间分辨率上抽象不同输入类型(即 RGB 和光流)表示的架构,使不同类型或来源的信息能够相互交互。我们称此方法为 AssembleNet,它在公开视频数据集上优于先前的方法,在某些情况下优势显著。我们在 Charades 上获得 58.6% mAP,在 Moments-in-Time 上获得 34.27% 准确率。

关键词

引用

@article{arxiv.1905.13209,
  title  = {AssembleNet: Searching for Multi-Stream Neural Connectivity in Video Architectures},
  author = {Michael S. Ryoo and AJ Piergiovanni and Mingxing Tan and Anelia Angelova},
  journal= {arXiv preprint arXiv:1905.13209},
  year   = {2020}
}