通过3D感知微调提升2D特征表示
计算机视觉与模式识别
2024-07-30 v1
摘要
当前的视觉基础模型仅在非结构化2D数据上进行训练,限制了其对物体和场景3D结构的理解。在本工作中,我们表明,对3D感知数据进行微调可提高新兴语义特征的质量。我们设计了一种方法,将语义2D特征提升到高效3D高斯表示中,这允许我们对任意视角进行重新渲染。使用渲染的3D感知特征,我们设计了一种微调策略,将这种3D感知性质转移到2D基础模型中。我们展示,通过这种方式微调的模型在语义分割和深度估计等下游任务性能通过简单线性探测即可获得显著提升。值得注意的是,尽管只在单个室内数据集上进行微调,但这种改进可迁移到多种室内数据集和超出域的数据集。我们希望我们的研究鼓励社区在训练2D基础模型时考虑注入3D感知。项目页面: https://ywyue.github.io/FiT3D
引用
@article{arxiv.2407.20229,
title = {Improving 2D Feature Representations by 3D-Aware Fine-Tuning},
author = {Yuanwen Yue and Anurag Das and Francis Engelmann and Siyu Tang and Jan Eric Lenssen},
journal= {arXiv preprint arXiv:2407.20229},
year = {2024}
}
备注
ECCV 2024. Project page: https://ywyue.github.io/FiT3D