MILA:基于高效帧间注意力的视频多任务学习
计算机视觉与模式识别
2021-10-12 v3
摘要
先前多任务学习的工作主要集中于单幅图像上的预测。本文中,我们提出一种通过高效帧间局部注意力(MILA)进行视频多任务学习的新方法。我们的方法包含一个新颖的帧间注意力模块,允许跨帧学习任务特定的注意力。我们将该注意力模块嵌入“慢-快”架构中,其中较慢的网络在稀疏采样的关键帧上运行,轻量浅层网络以高帧率在非关键帧上运行。我们还提出一种有效的对抗学习策略,以鼓励慢速与快速网络学习相似的特征。我们的方法在保持高质量预测的同时确保了低延迟的多任务学习。实验表明,在两个多任务学习基准上,与最先进方法相比具有竞争力的精度,同时将浮点运算次数(FLOPs)减少多达70%。此外,我们基于注意力的特征传播方法(ILA)在任务精度上优于先前工作,同时将FLOPs减少多达90%。
引用
@article{arxiv.2002.07362,
title = {MILA: Multi-Task Learning from Videos via Efficient Inter-Frame Attention},
author = {Donghyun Kim and Tian Lan and Chuhang Zou and Ning Xu and Bryan A. Plummer and Stan Sclaroff and Jayan Eledath and Gerard Medioni},
journal= {arXiv preprint arXiv:2002.07362},
year = {2021}
}
备注
Accepted in ICCV 2021 MTL Workshop