TransNormal:基于扩散模型的透明物体法线估计的稠密视觉语义
计算机视觉与模式识别
2026-02-03 v1
摘要
单目透明物体法线估计是实验室自动化的关键任务,但由于复杂的光线折射和反射,仍面临挑战。这些光学特性常导致传统深度和法线传感器出现灾难性失败,阻碍了具身 AI 在科学环境中的部署。我们提出 TransNormal,一种新型框架,通过适配预训练扩散先验进行单步法线回归。为处理透明表面纹理稀缺的问题,TransNormal 通过跨注意力机制整合来自 DINOv3 的稠密视觉语义,提供强大的几何线索。此外,我们采用多任务学习目标和小波基正则化,以确保保留细粒度结构细节。为支持此任务,我们引入 TransNormal-Synthetic,一个基于物理的合成数据集,具备高保真法线图。广泛的实验结果表明,TransNormal 在 ClearGrasp 数据集上将平均误差降低 24.4%,将 11.25° 精度提升 22.8%;在 ClearPose 上实现了 15.2% 的平均误差降低。代码和数据集将公开于 https://longxiang-ai.github.io/TransNormal。
引用
@article{arxiv.2602.00839,
title = {TransNormal: Dense Visual Semantics for Diffusion-based Transparent Object Normal Estimation},
author = {Mingwei Li and Hehe Fan and Yi Yang},
journal= {arXiv preprint arXiv:2602.00839},
year = {2026}
}
备注
Project Page: https://longxiang-ai.github.io/TransNormal