基于视觉基础模型的高效领域自适应多任务稠密预测
计算机视觉与模式识别
2026-03-10 v2
摘要
多任务稠密预测旨在联合解决语义分割和深度估计等任务,对于机器人应用至关重要,但在将模型部署到新环境时会受到域迁移的影响。虽然无监督域适应(UDA)为单任务解决了这一挑战,但现有的多任务UDA方法主要依赖对抗学习方法,效果不如最新的自训练技术。本文引入了FAMDA,这是一个简单而有效的UDA框架,通过将视觉基础模型(VFM)作为自训练范式中的强大教师来解决这一限制。我们的 метод将分段和深度基础模型整合到自训练范式中,用于生成目标域的高质量伪标签,有效地将其鲁棒的泛化能力蒸馏到单个高效学生网络中。大量实验表明,FAMDA在标准合成到真实的UDA多任务学习(MTL)基准以及一个具有挑战性的从日间到夜间适应任务上均实现了最先进(SOTA)性能。我们的框架能够训练出高度高效的模型;一个轻量级变体在保持SOTA精度的同时,比基础模型小超过10倍,凸显了FAMDA在为资源受限的机器人应用创建领域自适应且高效模型方面的适用性。
引用
@article{arxiv.2509.23626,
title = {Efficient Domain-Adaptive Multi-Task Dense Prediction with Vision Foundation Models},
author = {Beomseok Kang and Niluthpol Chowdhury Mithun and Mikhail Sizintsev and Han-Pang Chiu and Supun Samarasekera},
journal= {arXiv preprint arXiv:2509.23626},
year = {2026}
}