中文

视觉引导的机器人听觉

机器人学 2015-09-04 v2 计算机视觉与模式识别

摘要

在复杂且不可预测的环境中实现自然的人机交互是机器人学的主要研究方向之一。在典型的现实场景中,人类与机器人之间存在一定距离,且采集到的信号受到噪声、混响和其他干扰源的严重影响。在此背景下,说话人的检测与定位起着关键作用,因为它是多项任务(例如语音识别和说话人跟踪)的基础。我们探讨了人形机器人如何检测和定位既被看见又被听到的目标人物。我们引入了一种混合确定性/概率模型。确实,确定性分量使我们能够将视觉信息映射到听觉空间。借助概率分量,视觉特征引导听觉特征的分组以形成视听对象。所提出的模型及相关算法已在人形机器人 NAO 头部嵌入的立体相机对和两个麦克风上实时实现(17 FPS)。我们在 (i) 合成数据、(ii) 公开数据集以及 (iii) 利用该机器人采集的数据上进行了实验。所得结果验证了该方法的有效性,并鼓励我们进一步研究视觉如何辅助机器人听觉。

关键词

引用

@article{arxiv.1311.2460,
  title  = {Vision-Guided Robot Hearing},
  author = {Xavier Alameda-Pineda and Radu Horaud},
  journal= {arXiv preprint arXiv:1311.2460},
  year   = {2015}
}

备注

26 pages, many figures and tables, journal