基于神经架构搜索的视频动作识别
计算机视觉与模式识别
2019-07-11 v1 机器学习
摘要
深度神经网络在视频分析与理解方面取得了巨大成功。然而,设计高性能神经架构需要大量精力与专业知识。本文中,我们首次尝试让算法自动设计用于视频动作识别任务的神经网络。具体而言,时空网络在由有向无环图建模的可微空间中构建,从而可执行基于梯度的策略来搜索最优架构。尽管如此,由于评估每个架构候选的计算负担仍然沉重,该方法计算代价高昂。为缓解此问题,对于视频输入,我们引入时间分段方法以在不丢失全局视频信息的情况下降低计算成本。对于架构,我们通过引入伪 3D 算子在一个高效搜索空间中探索。实验表明,在从头训练协议下,我们的架构在具有挑战性的 UCF101 数据集上优于流行的神经架构,令人惊讶的是,其参数仅为人工设计对应架构的约百分之一。
引用
@article{arxiv.1907.04632,
title = {Video Action Recognition Via Neural Architecture Searching},
author = {Wei Peng and Xiaopeng Hong and Guoying Zhao},
journal= {arXiv preprint arXiv:1907.04632},
year = {2019}
}
备注
Accepted by IEEE ICIP2019