单目深度预训练用于语义分割的可行性研究
计算机视觉与模式识别
2024-07-19 v5
摘要
在几何任务上的预训练对于下游语义任务迁移是否可行这一问题十分重要,其原因一则实际,一则科学。若答案为肯定,我们或能大幅降低预训练成本及来自人类标注者的偏差。若答案为否定,则或可揭示具身性在演化史中语言与其他认知功能涌现的作用。为以当前手段可检验的方式框定该问题,我们在一个几何任务上预训练模型,并检验其是否可用于 priming 一种“物体”概念,从而在赋予符号(标签)后立即实现语义推断。我们选取单目深度预测作为几何任务,语义分割作为下游语义任务,并通过探索深度预训练与语义微调中不同形式的监督、训练流程与数据源,设计了一系列实证检验。我们发现单目深度是语义分割的一种可行预训练形式,其相对于常见基线的改进验证了这一点。基于上述发现,我们提出了改进背后若干可能机制,包括其与数据集规模、分辨率、架构、域内/域外源数据的关系,并通过广泛的消融研究加以验证。我们还发现,光流乍看或与深度预测同样有效(因其优化相同的光度重投影误差),却明显效力较低,因其并不显式旨在推断场景的潜在结构,而仅是时间相邻图像的表面现象。
引用
@article{arxiv.2203.13987,
title = {On the Viability of Monocular Depth Pre-training for Semantic Segmentation},
author = {Dong Lao and Fengyu Yang and Daniel Wang and Hyoungseob Park and Samuel Lu and Alex Wong and Stefano Soatto},
journal= {arXiv preprint arXiv:2203.13987},
year = {2024}
}