PhysX-Anything:从单张图像生成即插即用物理 3D 资产
计算机视觉与模式识别
2025-11-18 v1 机器人学
摘要
3D 模型正从静态的视觉表征转向具备物理和关节属性的可仿真资产,直接可用于仿真和交互。然而,大多数现有 3D 生成方法忽视了关键的物理和关节属性,限制了其在具身 AI 中的实用性。为填补这一差距,我们引入 PhysX-Anything,即首个能够从单张野外图像中生成高质量仿真就绪 3D 资产的框架,资产包含显式的几何、关节和物理属性。具体而言,我们提出了首个基于视觉语言模型的物理 3D 生成模型,以及一种高效对几何进行标记化的新型 3D 表示方法。它将标记数量降低了 193 倍,使我们能够在标准的 VLM 标记预算内进行显式几何学习,无需在微调期引入任何特殊标记,从而显著提升生成质量。此外,为克服现有物理 3D 数据集的多样性有限问题,我们构建了一个新的数据集 PhysX-Mobility,该数据集将先前物理 3D 数据集中的对象类别扩展超过 2 倍,并包含超过 2000 个常见真实世界对象的丰富物理标注。在 PhysX-Mobility 和野外图像上的大量实验表明,PhysX-Anything 能提供强大的生成性能和稳健的泛化能力。进一步的仿真实验在类 MuJoCo 环境中验证,我们的仿真就绪资产可直接用于具有接触性的机器人策略学习。我们相信 PhysX-Anything 可以显著赋能下游广泛应用,尤其是具身 AI 和基于物理的仿真。
引用
@article{arxiv.2511.13648,
title = {PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image},
author = {Ziang Cao and Fangzhou Hong and Zhaoxi Chen and Liang Pan and Ziwei Liu},
journal= {arXiv preprint arXiv:2511.13648},
year = {2025}
}
备注
Project page: https://physx-anything.github.io/