中文

指向时消解视觉物体歧义:一种无监督学习方法

计算机视觉与模式识别 2019-12-16 v1 机器学习 机器人学

摘要

每当我们指向某个特定物体或提及某一空间位置时,我们都在使用指称或指示手势,通常还伴有一些语言描述。尤其是 pointing 手势对于消除场景中的歧义十分必要,当言语交流因环境条件而失效,或两人根本不说同一种语言时,它们至关重要。随着人形机器人近年来的快速发展及其未来在家庭领域的融入,开发补充人机交互场景的手势接口具有重大研究价值。实现直观的手势场景仍具挑战性,因为指向意图与相应物体都必须被实时正确识别。在杂乱环境(如家庭环境)中考虑指向手势时,这一需求更为突出。此外,人类执行指向的方式多种多样,这些差异也必须被捕捉。该领域的研究常提出一组几何计算方法,这些方法在手势与物体数量增加时扩展性差,且需要使用特定标记或预定义的指向方向集合。本文提出一种无监督学习方法,利用按需增长(GWR)网络对指向手势的分布进行建模。我们引入了一种与人形机器人的交互场景,并定义了所谓的歧义类别。我们的手部与物体检测实现不依赖于任何标记或骨架模型,因此易于复现。我们将基线计算机视觉方法与我们的 GWR 模型进行评估比较,结果表明即便在物体邻近导致的歧义情况下,指向—物体关联也能被良好学习。

关键词

引用

@article{arxiv.1912.06449,
  title  = {Solving Visual Object Ambiguities when Pointing: An Unsupervised Learning Approach},
  author = {Doreen Jirak and David Biertimpel and Matthias Kerzel and Stefan Wermter},
  journal= {arXiv preprint arXiv:1912.06449},
  year   = {2019}
}