中文

ManipulaTHOR:一种视觉物体操控框架

计算机视觉与模式识别 2021-04-23 v1 人工智能 机器学习 机器人学

摘要

具身AI领域近期取得了实质性进展,尤其在智能体于环境中的导航方面。这些早期成功为该社区解决需要智能体主动与环境中的物体交互的任务奠定了基础。物体操控是机器人社区中一个成熟的研究领域,并带来若干挑战,包括操控器运动、抓取与长时序规划,尤其是在处理常被忽视的实际设定时:涉及视觉丰富且复杂的场景、使用移动智能体进行操控(而非桌面操控)、以及对未知环境与物体的泛化。我们提出一种构建于支持物理且视觉丰富的AI2-THOR框架之上的物体操控框架,并向具身AI社区提出一项称为ArmPointNav的新挑战。该任务将流行的点导航任务扩展至物体操控,并带来新的挑战,包括3D避障、在存在遮挡情况下操控物体,以及需要长期规划的多物体操控。在点导航挑战上成功的流行学习范式展现出潜力,但仍有很大改进空间。

关键词

引用

@article{arxiv.2104.11213,
  title  = {ManipulaTHOR: A Framework for Visual Object Manipulation},
  author = {Kiana Ehsani and Winson Han and Alvaro Herrasti and Eli VanderBilt and Luca Weihs and Eric Kolve and Aniruddha Kembhavi and Roozbeh Mottaghi},
  journal= {arXiv preprint arXiv:2104.11213},
  year   = {2021}
}

备注

CVPR 2021 -- (Oral presentation)