DynAlign:用于跨域分割的无监督动态分类法对齐
计算机视觉与模式识别
2025-01-29 v1
摘要
当前用于语义分割的无监督域适应 (UDA) 方法通常假设源域和目标域具有相同的类别标签。该假设忽略了在真实场景中普遍存在的标签级域差距,从而限制了它们在无需大量人工标注的情况下识别更细粒度或新类别的能力。基础模型的最新进展为解决这一局限性提供了有前景的方向,这些模型凭借丰富的先验知识展现出强大的泛化能力。然而,这些模型在处理域特定细节和代表性不足的细粒度类别时往往存在困难。为应对这些挑战,我们引入了 DynAlign,这是一个将 UDA 与基础模型相结合的框架,旨在弥合图像级和标签级的域差距。该方法利用先验语义知识,将源类别与目标类别进行对齐,目标类别可以是新类别、更细粒度类别或命名不同的类别(例如,车辆对齐到 {汽车、卡车、公交车})。随后,利用基础模型进行精确分割和类别重分配。为进一步提升准确性,我们提出了一种动态适应不同场景上下文的知识融合方法。DynAlign 能够在无需任何人工标注的情况下在新的目标标签空间中生成准确的预测,允许通过模型重训练或直接推理无缝适应新的分类法。在街景语义分割基准 GTA 到 Mapillary Vistas 以及 GTA 到 IDD 上的实验验证了本方法的有效性,并相较现有方法取得了显著提升。我们的代码将公开发布。
引用
@article{arxiv.2501.16410,
title = {DynAlign: Unsupervised Dynamic Taxonomy Alignment for Cross-Domain Segmentation},
author = {Han Sun and Rui Gong and Ismail Nejjar and Olga Fink},
journal= {arXiv preprint arXiv:2501.16410},
year = {2025}
}