跨域多模态RGB-D场景识别
计算机视觉与模式识别
2021-09-08 v2 机器人学
摘要
场景识别是计算机视觉研究中的基本问题之一,在机器人领域有广泛应用。在可用时,深度图像提供有用的几何线索,补充RGB纹理信息并有助于识别具有判别性的场景图像特征。近年来深度传感技术发展迅速,出现了多种多样的3D相机,各自具有不同的采集特性。然而,在面向大数据集时这些特性常被忽视,多模态图像被收集时未考虑其原始性质。在本工作中,我们聚焦于多模态场景识别数据集中可能存在的严重域偏移问题。因此,在一个相机上训练的场景分类模型可能无法泛化到来自不同相机的数据,仅提供较低的识别性能。从知名的SUN RGB-D数据集出发,我们设计了一个实验测试平台来研究该问题,并用它来基准测试现有方法的性能。最后,我们提出了一种新颖的自适应场景识别方法,利用模态间的自监督转换。实际上,学习从RGB到深度及反之是一个无监督过程,可在多相机数据上联合训练,并有助于弥合所提取特征分布之间的差距。我们的实验结果证实了所提方法的有效性。
引用
@article{arxiv.2103.14672,
title = {Multi-Modal RGB-D Scene Recognition Across Domains},
author = {Andrea Ferreri and Silvia Bucci and Tatiana Tommasi},
journal= {arXiv preprint arXiv:2103.14672},
year = {2021}
}
备注
Accepted at Deep Multi-Task Learning in Computer Vision (DeepMTL) workshop, ICCV 2021