LEXIS:从图像重建 3D 人体-物体交互的潜在接触签名
计算机视觉与模式识别
2026-04-23 v1 机器学习
摘要
从 RGB 图像重建 3D 人体-物体交互对于感知系统至关重要。然而,这仍然具有挑战性,因为需要捕捉身体与物体之间细微的物理耦合。当前方法依赖稀疏的、二元的接触线索,这些线索无法建模自然交互所特有的连续接近性和稠密空间关系。我们通过 InterFields 表示来解决这一限制,该表示对整个身体和物体表面进行稠密、连续的接近性编码。然而,从单张图像推断这些字段本身就是病态的。为解决这一问题,我们直觉认为交互模式在行动和物体几何的结构化特征中得体地呈现。我们在 LEXIS—a 一种通过 VQ-VAE 学习的交互签名离散流形中捕获了这种结构。我们随后开发了 LEXIS-Flow,一种扩散框架,利用 LEXIS 签名来估计人体和物体网格及其 InterFields。值得注意的是,这些 InterFields 有助于引导式细化,确保在无需事后优化的情况下实现物理上可信且接近感知的重建。在 Open3DHOI 和 BEHAVE 上的评估显示,LEXIS-Flow 在重建、接触和接近性质量方面显著优于现有 SOTA 基准。我们的ethods 不仅提高了泛化性,还产生更真实的重建,使我们更接近于整体 3D 场景理解。代码与模型将在 https://anticdimi.github.io/lexis 上公开。
关键词
引用
@article{arxiv.2604.20800,
title = {LEXIS: LatEnt ProXimal Interaction Signatures for 3D HOI from an Image},
author = {Dimitrije Antić and Alvaro Budria and George Paschalidis and Sai Kumar Dwivedi and Dimitrios Tzionas},
journal= {arXiv preprint arXiv:2604.20800},
year = {2026}
}
备注
26 pages, 11 figures, 4 tables. Project page: https://anticdimi.github.io/lexis