中文

扩散模型知晓透明性:将视频扩散模型重新用于透明物体深度与法线估计

计算机视觉与模式识别 2025-12-30 v1

摘要

透明物体对感知系统而言仍然出了名地困难:折射、反射和透射破坏了立体视觉、飞行时间(ToF)和纯判别式单目深度背后的假设,导致空洞和时间不稳定的估计。我们的关键观察是,现代视频扩散模型已经能够合成令人信服的透明现象,这表明它们已经内化了光学规则。我们构建了TransPhy3D,一个由透明/反射场景组成的合成视频语料库:使用Blender/Cycles渲染了11k个序列。场景由精心挑选的类别丰富静态资产库和形状丰富程序化资产库组装而成,并配以玻璃/塑料/金属材质。我们使用基于物理的光线追踪和OptiX去噪渲染RGB + 深度 + 法线。从一个大型视频扩散模型出发,我们通过轻量级LoRA适配器学习了一个用于深度(和法线)的视频到视频转换器。在训练期间,我们在DiT骨干网络中拼接RGB和(带噪)深度潜变量,并在TransPhy3D和现有的逐帧合成数据集上进行协同训练,从而对任意长度输入视频产生时间一致的预测。最终得到的模型DKT在涉及透明性的真实和合成视频基准上实现了零样本SOTA:ClearPose、DREDS(CatKnown/CatNovel)和TransPhy3D-Test。它在准确性和时间一致性上优于强大的图像/视频基线,其法线变体在ClearPose上设定了最佳的视频法线估计结果。一个紧凑的1.3B版本以约0.17秒/帧的速度运行。集成到抓取流程中,DKT的深度提升了在半透明、反射和漫反射表面上的成功率,优于先前的估计器。总之,这些结果支持了一个更广泛的论断:“扩散模型知晓透明性。”生成式视频先验可以被高效且无标签地重新利用,为具有挑战性的真实世界操作提供鲁棒、时间连贯的感知。

关键词

引用

@article{arxiv.2512.23705,
  title  = {Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation},
  author = {Shaocong Xu and Songlin Wei and Qizhe Wei and Zheng Geng and Hong Li and Licheng Shen and Qianpu Sun and Shu Han and Bin Ma and Bohan Li and Chongjie Ye and Yuhang Zheng and Nan Wang and Saining Zhang and Hao Zhao},
  journal= {arXiv preprint arXiv:2512.23705},
  year   = {2025}
}

备注

Project Page: https://daniellli.github.io/projects/DKT/; Code: https://github.com/Daniellli/DKT; Dataset: https://huggingface.co/datasets/Daniellesry/TransPhy3D