因式分解高阶CNN及其在时空情感估计中的应用
机器学习
2020-04-02 v2 计算机视觉与模式识别
图像与视频处理
机器学习
摘要
训练具有时空(即 3D)或高阶多维卷积的深度神经网络在计算上具有挑战性,因为跨数十层的未知参数达数百万。为缓解此问题,一种方法是对话卷积核应用低秩张量分解,以压缩网络并减少其参数数量。或者,可直接设计新的卷积模块(如 MobileNet)以提升效率。在本文中,我们统一了这两种方法,提出一个用于高效高阶多维(可分离)卷积的张量分解框架。有趣的是,所提框架实现了一种新颖的高阶转导,允许在给定域(例如 2D 图像或一般的 N 维数据)上训练网络,并利用转导推广到更高阶数据如视频(或一般的 (N+K) 维数据),例如捕获时间动态的同时保留已学习的空间信息。我们将提出的方法(称为 CP-高阶卷积(HO-CPConv))应用于时空面部情感分析。大多数现有面部情感模型聚焦于静态图像并丢弃所有时间信息。这是由于上述训练 3D 卷积网络的负担以及缺乏专家标注的大型视频数据。我们通过所提框架解决了这两个问题。初始训练先在静态图像上完成,随后利用转导推广到时域。我们在三个具有挑战性的大规模情感估计数据集 AffectNet、SEWA 和 AFEW-VA 上展示了优越性能。
引用
@article{arxiv.1906.06196,
title = {Factorized Higher-Order CNNs with an Application to Spatio-Temporal Emotion Estimation},
author = {Jean Kossaifi and Antoine Toisoul and Adrian Bulat and Yannis Panagakis and Timothy Hospedales and Maja Pantic},
journal= {arXiv preprint arXiv:1906.06196},
year = {2020}
}
备注
IEEE CVPR 2020