逐深度卷积即满足多视觉域学习之所需
计算机视觉与模式识别
2019-02-20 v2
摘要
设计能处理来自不同视觉域图像的模型正引起日益增长的兴趣。若不同视觉域中存在可通过公共参数化捕获的通用结构,那么我们可对全部域使用单一模型,而非每域一个模型。知晓不同域间关系的模型也可被训练以更少资源作用于新域。然而,辨识模型中可复用结构并非易事。本文中,我们提出一种基于逐深度可分离卷积的多域学习架构。所提方法基于如下假设:来自不同域的图像共享跨通道相关性,但具有域特定的空间相关性。所提模型紧凑,且在应用于新域时开销极小。此外,我们引入门控机制以促进不同域间的软共享。我们在视觉十项全能挑战赛(Visual Decathlon Challenge,多域模型能力测试基准)上评估了我们的方法。实验表明,我们的方法在仅需求最先进方法 50% 参数的同时,可取得最高分数。
引用
@article{arxiv.1902.00927,
title = {Depthwise Convolution is All You Need for Learning Multiple Visual Domains},
author = {Yunhui Guo and Yandong Li and Rogerio Feris and Liqiang Wang and Tajana Rosing},
journal= {arXiv preprint arXiv:1902.00927},
year = {2019}
}