用于RGB-D场景识别的翻译即识别网络
计算机视觉与模式识别
2019-04-30 v1
摘要
跨模态迁移有助于增强模态特定的判别能力以用于场景识别。为此,本文提出一个统一框架来整合跨模态翻译与模态特定识别任务,称为翻译即识别网络(Translate-to-Recognize Network, TRecgNet)。具体而言,翻译与识别任务共享相同的编码器网络,这使得能够借助翻译显式地正则化识别任务的训练,从而提升其最终的泛化能力。对于翻译任务,我们在编码器网络之上放置一个解码器模块,并使用一种新的逐层语义损失对其进行优化;而对于识别任务,我们基于编码器的特征嵌入使用线性分类器,其训练由标准交叉熵损失引导。此外,我们的TRecgNet允许利用大量无标签的RGB-D数据来训练翻译任务,从而提升编码器网络的表征能力。通过实验我们验证了这种新的半监督设定能够进一步增强识别网络的性能。我们在两个RGB-D场景识别基准数据集NYU Depth v2和SUN RGB-D上进行了实验,表明TRecgNet取得了优于现有最先进方法的性能,尤其是在仅基于单一模态的识别上。
引用
@article{arxiv.1904.12254,
title = {Translate-to-Recognize Networks for RGB-D Scene Recognition},
author = {Dapeng Du and Limin Wang and Huiling Wang and Kai Zhao and Gangshan Wu},
journal= {arXiv preprint arXiv:1904.12254},
year = {2019}
}
备注
Accepted by CVPR 2019. Project: https://ownstyledu.github.io/Translate-to-Recognize-Networks/