中文

RL Dreams:基于得分蒸馏的 3D 生成策略梯度优化

计算机视觉与模式识别 2023-12-11 v1

摘要

得益于生成建模领域的进展,3D 生成在过去十年中迅速加速。基于得分蒸馏采样(SDS)的渲染极大地改善了 3D 资产生成。此外,最近的去噪扩散策略优化(DDPO)工作表明,扩散过程与策略梯度方法兼容,并已证明可使用美学评分函数改进 2D 扩散模型。我们首先展示该美学评分器可作为多种基于 SDS 方法的强引导,并证明了其在文本到 3D 合成中的有效性。进一步地,我们利用 DDPO 方法来提升从 2D 扩散模型获得的 3D 渲染质量。我们的方法 DDPO3D 将策略梯度方法与美学评分结合使用。据我们所知,这是首个将策略梯度方法扩展到基于 3D 得分的渲染,并在 DreamGaussian 等当前推动文本到 3D 合成研究的基于 SDS 的方法上显示出改进的方法。我们的方法与基于得分蒸馏的方法兼容,这将有助于将多样化的奖励函数集成到生成过程中。我们的项目页面可通过 https://ddpo3d.github.io 访问。

关键词

引用

@article{arxiv.2312.04806,
  title  = {RL Dreams: Policy Gradient Optimization for Score Distillation based 3D Generation},
  author = {Aradhya N. Mathur and Phu Pham and Aniket Bera and Ojaswa Sharma},
  journal= {arXiv preprint arXiv:2312.04806},
  year   = {2023}
}