通过异步视听融合寻找掉落物体
计算机视觉与模式识别
2022-07-08 v1 机器学习
机器人学
声音
音频与语音处理
摘要
物体的外观与声音为其物理属性提供了互补的反映。在许多场景中,视觉与听觉线索异步到达但必须被整合,例如当我们听到物体掉落在地板上然后必须找到它时。在本文中,我们引入了一种设定来研究 3D 虚拟环境中的多模态物体定位。一个物体被掉落在房间某处。一个配备摄像头与麦克风的具身机器人智能体必须通过结合音频与视觉信号以及底层物理知识,来确定掉落了什么物体以及在哪里。为研究此问题,我们生成了一个大规模数据集——Fallen Objects 数据集——包含 64 个房间中 30 个物理物体类别的 8000 个实例。该数据集使用 ThreeDWorld 平台,可模拟基于物理的冲击声音以及物体在逼真设定下的复杂物理交互。作为应对此挑战的第一步,我们开发了一组基于模仿学习、强化学习和模块化规划的具身智能体基线,并对这一新任务的挑战进行了深入分析。
引用
@article{arxiv.2207.03483,
title = {Finding Fallen Objects Via Asynchronous Audio-Visual Integration},
author = {Chuang Gan and Yi Gu and Siyuan Zhou and Jeremy Schwartz and Seth Alter and James Traer and Dan Gutfreund and Joshua B. Tenenbaum and Josh McDermott and Antonio Torralba},
journal= {arXiv preprint arXiv:2207.03483},
year = {2022}
}
备注
CVPR 2022. Project page: http://fallen-object.csail.mit.edu