中文

基于提示化接触链的统一人-场景交互

计算机视觉与模式识别 2024-11-06 v5

摘要

人-场景交互(HSI)是具身 AI 与虚拟现实等领域的重要组成部分。尽管在运动质量与物理合理性上有所进展,在 HSI 实际应用前,两个关键因素——多样交互控制与用户友好界面开发——仍需进一步探索。本文提出统一 HSI 框架 UniHSI,其通过语言指令支持对多样交互的统一控制。该框架建立于将交互定义为接触链(CoC)之上:即人体关节-物体部件配对步骤,其受交互类型与人-物接触区域强相关性启发。基于此定义,UniHSI 包含一个大语言模型(LLM)规划器将语言提示翻译为 CoC 形式的任务规划,以及一个统一控制器将 CoC 转为统一任务执行。为便利训练与评估,我们收集了名为 ScenePlan 的新数据集,涵盖基于多样场景由 LLM 生成的数千任务规划。综合实验证明了我们的框架在多样任务执行上的有效性及对真实扫描场景的泛化能力。项目页见 https://github.com/OpenRobotLab/UniHSI。

关键词

引用

@article{arxiv.2309.07918,
  title  = {Unified Human-Scene Interaction via Prompted Chain-of-Contacts},
  author = {Zeqi Xiao and Tai Wang and Jingbo Wang and Jinkun Cao and Wenwei Zhang and Bo Dai and Dahua Lin and Jiangmiao Pang},
  journal= {arXiv preprint arXiv:2309.07918},
  year   = {2024}
}

备注

A unified Human-Scene Interaction framework that supports versatile interactions through language commands.Project URL: https://xizaoqu.github.io/unihsi/ . Code: https://github.com/OpenRobotLab/UniHSI