中文

JointDiT:利用扩散 Transformer 增强 RGB-Depth 联合建模

计算机视觉与模式识别 2025-08-06 v3 人工智能

摘要

我们提出了 JointDiT,一种对 RGB 和深度的联合分布进行建模的扩散 Transformer。通过利用最先进的扩散 Transformer 的架构优势和出色的图像先验,JointDiT 不仅能生成高保真图像,还能产生几何上合理且准确的深度图。这种稳健的联合分布建模是通过我们提出的两种简单而有效的技术实现的,即取决于每个模态噪声水平的自适应调度权重,以及不平衡时间步采样策略。借助这些技术,我们在每个模态的所有噪声水平上训练我们的模型,使得 JointDiT 能够通过简单控制每个分支的时间步,自然地处理各种组合生成任务,包括联合生成、深度估计和深度条件图像生成。JointDiT 展示了出色的联合生成性能。此外,它在深度估计和深度条件图像生成方面取得了可比的结果,这表明联合分布建模可以作为条件生成的可行替代方案。项目页面可在 https://byungki-k.github.io/JointDiT/ 获取。

关键词

引用

@article{arxiv.2505.00482,
  title  = {JointDiT: Enhancing RGB-Depth Joint Modeling with Diffusion Transformers},
  author = {Kwon Byung-Ki and Qi Dai and Lee Hyoseok and Chong Luo and Tae-Hyun Oh},
  journal= {arXiv preprint arXiv:2505.00482},
  year   = {2025}
}

备注

Accepted to IEEE/CVF International Conference on Computer Vision (ICCV) 2025. Project page: https://byungki-k.github.io/JointDiT/ Code: https://github.com/kaist-ami/JointDiT