中文

InHabit:利用图像基础模型实现可扩展的3D人体放置

计算机视觉与模式识别 2026-05-27 v2

摘要

训练具身智能体像人类一样理解3D场景,需要人类与多样环境进行有意义交互的大规模数据,然而此类数据非常稀缺。真实世界采集成本高昂且局限于受控环境,而现有的合成数据集依赖简单的几何启发式方法,忽略了丰富的场景上下文。相比之下,在互联网规模上训练的2D基础模型已经获得了关于人与环境交互的常识知识。为了将这些知识转移到3D,我们引入了InHabit,一个自动且可扩展的数据生成器,用于在3D场景中填充交互的人类。InHabit遵循“渲染-生成-提升”原则:给定渲染的3D场景,视觉-语言模型提出上下文有意义的动作,图像编辑模型插入人物,优化过程将编辑结果提升为与场景几何对齐的物理上合理的SMPL-X人体。应用于Habitat-Matterport3D,InHabit生成了InHabitants,这是首个大规模逼真3D人-场景交互数据集,包含跨约800个建筑级场景的78K个样本,具有完整的3D几何、SMPL-X人体和图像。用InHabitants增强标准训练数据可改善基于RGB的3D人-场景重建和接触估计,并且在感知用户研究中,我们的数据在78%的情况下优于先前方法。

关键词

引用

@article{arxiv.2604.19673,
  title  = {InHabit: Leveraging Image Foundation Models for Scalable 3D Human Placement},
  author = {Nikita Kister and Pradyumna YM and István Sárándi and Jiayi Wang and Anna Khoreva and Gerard Pons-Moll},
  journal= {arXiv preprint arXiv:2604.19673},
  year   = {2026}
}