MaskAdapt:使用多模态上下文学习与 RGB-Depth 掩码的无监督几何感知域适应
计算机视觉与模式识别
2025-06-02 v1 人工智能
摘要
作物与杂草的语义分割对于特定地点的农田管理至关重要;然而,现有大多数方法依赖于费力的像素级标注。当在一个农田(源域)上训练的模型由于域偏移(如光照、相机设置、土壤成分和作物生长阶段的变化)而无法泛化到新农田(目标域)时,进一步的挑战便出现了。无监督域适应(UDA)通过在无目标域标签的情况下实现适应来解决这一问题,但当前的 UDA 方法在处理遮挡以及作物与杂草之间的视觉混合时存在困难,导致在真实世界条件下出现误分类。为了克服这些限制,我们引入了 MaskAdapt,这是一种通过将 RGB 图像与从深度数据中提取的特征相整合,利用多模态上下文学习来增强分割精度的新方法。通过从深度图计算深度梯度,我们的方法捕捉了有助于解决纹理模糊的空间过渡。这些梯度通过交叉注意力机制细化了 RGB 特征表示,从而实现了更清晰的边界描绘。此外,我们提出了一种几何感知掩码策略,在训练期间应用水平、垂直和随机掩码。这鼓励模型关注更广泛的空间上下文,以实现鲁棒的视觉识别。在真实农业数据集上的评估表明,MaskAdapt 始终优于现有的 State-of-the-Art (SOTA) UDA 方法,在各种农田条件下均实现了改善的分割平均交并比(mIOU)。
引用
@article{arxiv.2505.24026,
title = {MaskAdapt: Unsupervised Geometry-Aware Domain Adaptation Using Multimodal Contextual Learning and RGB-Depth Masking},
author = {Numair Nadeem and Muhammad Hamza Asad and Saeed Anwar and Abdul Bais},
journal= {arXiv preprint arXiv:2505.24026},
year = {2025}
}
备注
11 pages, 5 figures, presented at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025. Reviewer comments available upon request