穿越薛定谔桥:面向文本到 3D 生成的直接轨迹
计算机视觉与模式识别
2025-11-11 v1 人工智能
摘要
近期针对基于优化的文本到 3D 生成技术取得了重要进展,然而这些技术往往依赖从预训练文本到图像扩散模型蒸馏知识,例如得分蒸馏抽样(SDS),从而在生成的 3D 资产中引入过饱和和过平滑等伪影。本文通过将生成过程形式化为学习当前渲染分布与目标期望分布之间的最优直接传输轨迹,从而实现在较小的分类器自由引导(CFG)值下获得高质量生成。首先,我们在理论上将 SDS 证明为薛定谔桥框架的一个简化实例。我们证明,SDS 使用的是薛定谔桥的逆过程;在特定条件下(例如将一个端点设为高斯噪声),该逆过程简化为 SDS 中预训练扩散模型的得分函数。基于此,我们引入轨迹中心蒸馏(TraCe),这是一种新的文本到 3D 生成框架,重新塑造薛定谔桥可追踪的数学框架,显式构造从当前渲染到其文本条件化去噪目标的扩散桥,并在该轨迹的得分动力学上训练一个适配 LoRA 的模型,以实现稳健的 3D 优化。综合实验表明,TraCe 在质量和保真度上持续优于当前最先进的技术。
引用
@article{arxiv.2511.05609,
title = {Walking the Schr\"odinger Bridge: A Direct Trajectory for Text-to-3D Generation},
author = {Ziying Li and Xuequan Lu and Xinkui Zhao and Guanjie Cheng and Shuiguang Deng and Jianwei Yin},
journal= {arXiv preprint arXiv:2511.05609},
year = {2025}
}
备注
NeurIPS 2025; https://github.com/emmaleee789/TraCe.git