ORIGEN:面向文本到图像生成的零样本 3D 方向基准
计算机视觉与模式识别
2025-10-28 v3 机器学习
摘要
我们提出 ORIGEN,这是首个实现 3D 方向基准的零样本文本到图像生成方法,支持多个对象和多样化类别。虽然前期工作在图像生成中主要关注 2D 位置,却缺乏对 3D 方向的控制。为此,我们提出一种基于预训练判别模型进行 3D 方向估计的奖励引导采样方法,以及一种一阶文本到图像生成流模型。虽然梯度上升是奖励引导的自然选择,但难以维持图像的真实性。相反,我们采用基于 Langevin 动力学的采样方法,将随机噪声注入梯度上升——仅需一行额外代码。此外,我们引入基于奖励函数的自适应时间重缩放,以加速收敛。我们的实验表明,ORIGEN 在定量指标和用户研究中均优于训练时方法和测试时引导方法。
引用
@article{arxiv.2503.22194,
title = {ORIGEN: Zero-Shot 3D Orientation Grounding in Text-to-Image Generation},
author = {Yunhong Min and Daehyeon Choi and Kyeongmin Yeo and Jihyun Lee and Minhyuk Sung},
journal= {arXiv preprint arXiv:2503.22194},
year = {2025}
}
备注
Project Page: https://origen2025.github.io