CHORUS:从无界合成图像中学习规范化的三维人-物空间关系
计算机视觉与模式识别
2023-09-06 v2 人工智能
摘要
我们提出了一种以自监督方式教机器理解并建模三维空间中多样化人-物交互潜在空间常识的方法。这是一项具有挑战性的任务,因为可被视为类人与自然的交互存在特定的流形,但即便对于相似的交互,人体姿态与物体几何形状也可能发生变化。这种多样性使得三维交互的标注任务困难且难以扩展,从而限制了以监督方式对其进行推理的潜力。学习交互过程中人与物体之间三维空间关系的一种途径,是展示人类与同类物体交互时从不同视角捕获的多张二维图像。我们方法的核心思想是利用一个生成模型,该模型从任意文本提示输入生成高质量二维图像,将其作为具有有效可控性与视角多样性的“无界”数据生成器。尽管其图像质量相较真实图像存在不完善之处,我们证明合成图像足以用于学习三维人-物空间关系。我们提出了多种利用合成图像的策略,包括:(1)首个利用生成图像模型进行三维人-物空间关系学习的方法;(2)通过带姿态规范化的三维占据推理,以自监督方式从不一致二维线索推理三维空间关系的框架;(3)语义聚类以消歧同类型物体不同交互方式;(4)评估交互三维空间学习质量的新型度量。
引用
@article{arxiv.2308.12288,
title = {CHORUS: Learning Canonicalized 3D Human-Object Spatial Relations from Unbounded Synthesized Images},
author = {Sookwan Han and Hanbyul Joo},
journal= {arXiv preprint arXiv:2308.12288},
year = {2023}
}
备注
Accepted to ICCV 2023 (Oral Presentation). Project Page: https://jellyheadandrew.github.io/projects/chorus