中文

HIS-GPT:迈向 3D 场景中人-在-场景的多模态理解

计算机视觉与模式识别 2025-07-17 v2

摘要

我们提出了一项新任务,用于对具身智能体的人-在-场景理解进行基准测试:人-在-场景问答 (HIS-QA)。给定 3D 场景中的人类运动,HIS-QA 要求智能体理解人类状态与行为,推理其周围环境,并回答场景中与人类相关的问题。为支持这一新任务,我们提出了 HIS-Bench,这是一个多模态基准,能够跨广泛范围(从基础感知到常识推理与规划)系统地评估 HIS 理解能力。我们在 HIS-Bench 上对各种视觉-语言模型进行评估,揭示了它们在处理 HIS-QA 任务方面的显著局限性。为此,我们提出了 HIS-GPT,这是首个用于 HIS 理解的基础模型。HIS-GPT 将 3D 场景上下文和人体运动动力学集成到大语言模型中,同时结合了捕捉人-场景交互的专门机制。大量实验表明,HIS-GPT 在 HIS-QA 任务上确立了新的 SOTA。我们希望这项工作能激发未来关于 3D 场景中人类行为分析的研究,推动具身 AI 和世界模型的发展。代码和数据:https://github.com/ZJHTerry18/HumanInScene。

关键词

引用

@article{arxiv.2503.12955,
  title  = {HIS-GPT: Towards 3D Human-In-Scene Multimodal Understanding},
  author = {Jiahe Zhao and Ruibing Hou and Zejie Tian and Hong Chang and Shiguang Shan},
  journal= {arXiv preprint arXiv:2503.12955},
  year   = {2025}
}

备注

ICCV 2025