中文

Articulate3D:零样本文本驱动的 3D 物体姿态控制

计算机视觉与模式识别 2025-08-27 v1

摘要

我们提出了一种无需训练的方法 Articulate3D,通过语言控制来调整 3D 资产的姿态。尽管视觉和语言模型取得了进展,这项任务仍然出人意料地具有挑战性。为实现这一目标,我们将问题分解为两个步骤。我们修改了一个强大的图像生成器,使其能根据输入图像和文本指令创建目标图像。然后,我们通过多视角姿态优化步骤将网格对齐到目标图像。具体而言,我们引入了一种自注意力重连机制(RSActrl),该机制在图像生成模型中将源结构与姿态解耦,使其能在不同姿态下保持结构一致性。我们观察到,可微渲染对于关节优化而言是一个不可靠的信号;因此,我们转而使用关键点来建立输入图像与目标图像之间的对应关系。Articulate3D 的有效性在多种 3D 物体和自由形式的文本提示上得到了验证,成功地在保持网格原始身份的同时操控了姿态。定量评估和一项对比用户研究(我们的方法在超过 85% 的情况下被首选)证实了其优于现有方法。项目页面:https://odeb1.github.io/articulate3d_page_deb/

关键词

引用

@article{arxiv.2508.19244,
  title  = {Articulate3D: Zero-Shot Text-Driven 3D Object Posing},
  author = {Oishi Deb and Anjun Hu and Ashkan Khakzar and Philip Torr and Christian Rupprecht},
  journal= {arXiv preprint arXiv:2508.19244},
  year   = {2025}
}

备注

Project page:https://odeb1.github.io/articulate3d_page_deb/