中文

语言引导的实例感域自适应全景分割

计算机视觉与模式识别 2024-12-30 v2 人工智能

摘要

全景分割的日益重要性与自动驾驶和 AR/VR 应用的进展密切相关。然而,由于密集数据标注的高昂成本,此类模型的部署受限,导致出现无监督域适应(UDA)问题。在全景 UDA 中,一个关键挑战是减少带标签源域与无标签目标域之间的域间差距,同时调和语义分割和实例分割子任务,以限制灾难性干扰。尽管已取得显著进展,现有方法主要关注语义分割的适应。在本工作中,我们通过一种新颖的实例感知跨域混合策略(IMix)来引入实例级适应。IMix 通过提高实例分割性能显著增强全景质量。具体而言,我们提出在源图像上插入来自目标域的高置信度预测实例,保留结果伪标签的完整性,同时减少注入的确认偏差。然而,这种增强会以语义性能下降为代价,归因于灾难性遗忘。为缓解此问题,我们采用基于 CLIP 的域对齐(CDA)对语义分支进行正则化,利用自然语言提示的域鲁棒性。最终,我们提出一种集成这两种机制的端到端模型,称为 LIDAPS, 在所有流行的全景 UDA基准测试中实现了最先进的成绩。

关键词

引用

@article{arxiv.2404.03799,
  title  = {Language-Guided Instance-Aware Domain-Adaptive Panoptic Segmentation},
  author = {Elham Amin Mansour and Ozan Unal and Suman Saha and Benjamin Bejar and Luc Van Gool},
  journal= {arXiv preprint arXiv:2404.03799},
  year   = {2024}
}

备注

Accepted at the 2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)