超越相机:世界坐标系中的神经网络
计算机视觉与模式识别
2020-03-13 v1
摘要
眼动并将视觉视野策略性地置于视网膜上,使动物获得场景的更高分辨率并抑制干扰信息。这一基础系统在基于深度网络的视频理解中一直缺失,后者通常局限于锁定在相机帧上的224×224像素内容。我们提出一个简单的想法WorldFeatures,其中每一层每个特征都具有空间变换,特征图仅在需要时才被变换。我们展示,使用这些WorldFeatures构建的网络可用于建模眼动,如扫视、注视和平滑追踪,即使在预录制视频的批量设置中亦可。即,网络例如可在一时刻使用全部224×224像素观察小细节,下一时刻观看整个场景。我们展示典型构建模块(如卷积和池化)可使用现有工具适配以支持WorldFeatures。实验在Charades、Olympic Sports和Caltech-UCSD Birds-200-2011数据集上展开,探索动作识别、细粒度识别和视频稳定。
引用
@article{arxiv.2003.05614,
title = {Beyond the Camera: Neural Networks in World Coordinates},
author = {Gunnar A. Sigurdsson and Abhinav Gupta and Cordelia Schmid and Karteek Alahari},
journal= {arXiv preprint arXiv:2003.05614},
year = {2020}
}