中文

RL在文本到3D生成中是否就绪?一项渐进式研究

计算机视觉与模式识别 2025-12-12 v1 人工智能 计算与语言

摘要

强化学习(RL)此前已被证明在大语言和多模态模型中有效,并已成功扩展用于增强2D图像生成。然而,将RL应用于3D生成仍 largely 未被探索,原因在于3D对象更高的空间复杂性需要全局一致的几何和细粒度的局部纹理。这使得3D生成对奖励设计和RL算法高度敏感。为应对这些挑战,我们对RL用于文本到3D自回归生成进行了首次系统性研究,涵盖多个维度。(1)奖励设计:我们评估奖励维度和模型选择,表明与人类偏好的一致性至关重要,且通用多模态模型为3D属性提供鲁棒信号。(2)RL算法:我们研究GRPO变体,强调token级优化的有效性,并进一步研究训练数据和迭代的扩展。(3)文本到3D基准:由于现有基准无法衡量3D生成模型中的隐式推理能力,我们引入了MME-3DR。(4)高级RL范式:受3D生成自然层次结构的启发,我们提出Hi-GRPO,通过专用奖励集成优化全局到局部的层次化3D生成。基于这些洞察,我们开发了AR3D-R1,第一个RL增强的文本到3D模型,从粗形状到纹理细化。我们希望本研究为RL驱动的3D生成推理提供见解。代码已发布至https://github.com/Ivan-Tang-3D/3DGen-R1。

关键词

引用

@article{arxiv.2512.10949,
  title  = {Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation},
  author = {Yiwen Tang and Zoey Guo and Kaixin Zhu and Ray Zhang and Qizhi Chen and Dongzhi Jiang and Junli Liu and Bohan Zeng and Haoming Song and Delin Qu and Tianyi Bai and Dan Xu and Wentao Zhang and Bin Zhao},
  journal= {arXiv preprint arXiv:2512.10949},
  year   = {2025}
}

备注

Code is released at https://github.com/Ivan-Tang-3D/3DGen-R1