中文

BoMuDANet:面向非结构化驾驶环境中视觉场景理解的无监督自适应网络

计算机视觉与模式识别 2025-02-13 v3 图像与视频处理

摘要

我们提出了一种用于非结构化交通环境中视觉场景理解的无监督自适应方法。我们的方法针对由汽车、卡车、两轮和三轮车辆以及行人组成的密集且异构交通的非结构化真实场景而设计。我们描述了一种基于无监督域自适应 (DA) 的新语义分割技术,可识别 RGB 图像或视频中每个区域的类别。我们还提出了一种用于多源 DA 的新自训练算法 (Alt-Inc),以提高准确率。我们的整体方法是一种基于深度学习的技术,由一个无监督神经网络组成,在具有挑战性的 India Driving Dataset 上达到了 87.18% 的准确率。我们的方法在可能未良好标记或包含泥土、无法识别的碎片、坑洼等的道路上表现良好。我们方法的一个关键方面是它还能识别在测试阶段模型首次遇到的物体。我们将我们的方法与最先进的方法进行比较,显示出 5.17% - 42.9% 的提升。此外,我们还进行了用户研究,从定性上验证了非结构化驾驶环境视觉场景理解的改进。

关键词

引用

@article{arxiv.2010.03523,
  title  = {BoMuDANet: Unsupervised Adaptation for Visual Scene Understanding in Unstructured Driving Environments},
  author = {Divya Kothandaraman and Rohan Chandra and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2010.03523},
  year   = {2025}
}