利用弱监督掩码数据蒸馏使机器人理解以人为中心环境中的上下文信息
计算机视觉与模式识别
2020-12-16 v1 机器人学
摘要
人类环境中的上下文信息,如标志、符号和物体,为机器人提供用于探索和导航的重要信息。为从在这些环境中获取的复杂图像中识别并分割上下文信息,采用了卷积神经网络(CNNs)等数据驱动方法。然而,这些方法需要大量人工标注数据,获取过程缓慢且耗时。弱监督方法通过生成伪分割标签(PSLs)来解决这一限制。在本文中,我们提出一种新颖的弱监督掩码数据蒸馏(WeSuperMaDD)架构,用于自主生成 PSLs,所使用的 CNNs 并非专门针对上下文分割任务训练,即用于物体分类、图像描述等任务的 CNNs。WeSuperMaDD 独特地利用从稀疏且多样性有限的数据中学习到的图像特征来生成 PSLs;这类数据在以人为中心的环境(商场、杂货店)中的机器人导航任务里十分常见。我们提出的架构使用一种新的掩码精化系统,自动搜索满足代价约束且前景像素最少的 PSL,从而免除了对手工启发式规则的需求。大量实验成功验证了 WeSuperMaDD 在多种室内/室外环境中为具有不同尺度、字体和视角的文本数据集生成 PSLs 的性能。与 Naive、GrabCut 和 Pyramid 方法的比较发现,标签与分割质量有显著提升。此外,使用 WeSuperMaDD 架构训练的上下文分割 CNN 相比使用 Naive PSLs 训练的 CNN 在精度上取得了可测量的改进。我们的方法在真实数据集上无需分割标签进行训练,性能也与现有最先进的文本检测与分割方法相当。
引用
@article{arxiv.2012.08282,
title = {Robots Understanding Contextual Information in Human-Centered Environments using Weakly Supervised Mask Data Distillation},
author = {Daniel Dworakowski and Goldie Nejat},
journal= {arXiv preprint arXiv:2012.08282},
year = {2020}
}
备注
14 pages and 8 figures