神经多感官场景推断
机器学习
2019-11-11 v2 机器学习
摘要
对于具身智能体而言,要推断其所处底层 3D 物理世界的表示,应高效结合来自多次试验的多感官线索,例如通过观看与触摸物体。尽管十分重要,多感官 3D 场景表示学习相较于单模态设定受到的关注仍较少。本文中,我们提出生成式多感官网络(GMN),用于学习可通过多种感官模态部分观测的 3D 场景的潜表示。我们还引入一种称为摊销专家乘积(Amortized Product-of-Experts)的新方法,以提升计算效率及在测试时面对未见模态组合的鲁棒性。实验结果表明,所提模型能从任意模态组合高效推断鲁棒的模态不变 3D 场景表示,并执行准确的跨模态生成。为开展此探索,我们还开发了多感官具身 3D 场景环境(MESE)。
引用
@article{arxiv.1910.02344,
title = {Neural Multisensory Scene Inference},
author = {Jae Hyun Lim and Pedro O. Pinheiro and Negar Rostamzadeh and Christopher Pal and Sungjin Ahn},
journal= {arXiv preprint arXiv:1910.02344},
year = {2019}
}