复制粘贴相干深度区域改进城市场景分割的对比学习
计算机视觉与模式识别
2022-11-28 v1
摘要
在本工作中,我们利用估计深度来增强用于城市场景分割的自监督对比学习,其中未标记视频易于获取以训练自监督深度估计。我们认为,3D空间中一组相干像素的语义是自包含的,并且在其出现的上下文下是不变的。我们根据估计深度将相干、语义相关的像素分组为相干深度区域,并使用复制粘贴来合成地改变其上下文。通过这种方式,在对比学习中建立了跨上下文对应,并学习了上下文不变表示。对于城市场景的无监督语义分割,我们的方法在Cityscapes上以mIoU超越先前最先进基线+7.14%,在KITTI上超越+6.65%。对于在Cityscapes和KITTI分割上的微调,我们的方法可与现有模型竞争,然而,我们无需在ImageNet或COCO上预训练,且计算效率更高。我们的代码可在 https://github.com/LeungTsang/CPCDR 获取。
引用
@article{arxiv.2211.14074,
title = {Copy-Pasting Coherent Depth Regions Improves Contrastive Learning for Urban-Scene Segmentation},
author = {Liang Zeng and Attila Lengyel and Nergis Tömen and Jan van Gemert},
journal= {arXiv preprint arXiv:2211.14074},
year = {2022}
}
备注
BMVC 2022 Best Student Paper Award(Honourable Mention)