Auto-X3D:通过更细粒度的神经架构搜索实现超高效视频理解
计算机视觉与模式识别
2021-12-10 v1
摘要
高效的视频架构是在计算资源有限的设备上部署视频识别系统的关键。遗憾的是,现有的视频架构通常计算密集,不适合此类应用。最近的 X3D 工作通过沿空间、时间、宽度和深度等多个轴扩展手工设计的图像架构,提出了一系列新的高效视频模型。尽管在一个概念上很大的空间中操作,X3D 一次只搜索一个轴,并且总共仅探索了 30 种架构的小集合,未能充分探索该空间。本文绕过了现有的 2D 架构,直接在细粒度空间中搜索 3D 架构,其中块类型、滤波器数量、扩展比和注意力块被联合搜索。我们采用了一种概率神经架构搜索方法,以在如此大的空间中高效搜索。在 Kinetics 和 Something-Something-V2 基准上的评估证实,我们的 AutoX3D 模型在相似 FLOPs 下,准确率最高可超越现有模型 1.3%,并且在达到相似性能时,计算成本最多可降低至原来的 1/1.74。
引用
@article{arxiv.2112.04710,
title = {Auto-X3D: Ultra-Efficient Video Understanding via Finer-Grained Neural Architecture Search},
author = {Yifan Jiang and Xinyu Gong and Junru Wu and Humphrey Shi and Zhicheng Yan and Zhangyang Wang},
journal= {arXiv preprint arXiv:2112.04710},
year = {2021}
}
备注
Accepted by WACV'2022