中文

THOM:从文本生成物理合理的手-物三维网格

数值分析 2026-04-06 v1 数值分析 最优化与控制

摘要

从文本生成照片级真实感的三维手-物交互(HOI)对于机器人抓取和AR/VR内容创作等应用具有重要意义。然而,在实践中,同时实现视觉保真度和物理合理性仍然很困难,因为从文本生成的高斯分布中提取网格本质上是病态的,且生成的网格通常无法用于基于物理的优化。我们提出了THOM,一个无需训练的框架,可直接从文本提示生成物理合理的三维HOI网格,无需模板物体网格。THOM遵循一个两阶段流程:首先,由文本引导生成手部和物体的高斯分布,然后通过基于物理的优化细化它们的交互。为实现可靠的交互建模,我们引入了一种具有显式顶点到高斯映射的网格提取方法,从而实现拓扑感知正则化。我们进一步通过接触感知优化和视觉语言模型(VLM)引导的翻译细化来提高物理合理性。大量实验表明,THOM产生了具有强文本对齐、视觉真实性和交互合理性的高质量HOI。

关键词

引用

@article{arxiv.2604.02735,
  title  = {Error Estimates of the Gain Approximation by Hermite-Galerkin Method in Feedback Particle Filter},
  author = {Ruoyu Wang and Peng Sun and Xue Luo},
  journal= {arXiv preprint arXiv:2604.02735},
  year   = {2026}
}

备注

8 pages, 3 figures, 1 table