细化与表征:区域到对象的表征学习
计算机视觉与模式识别
2022-12-22 v2
摘要
自监督学习近期的工作表明,通过以对象为中心或基于区域的对应目标进行预训练,在场景级密集预测任务上取得了强劲性能。本文提出区域到对象的表征学习(R2O),统一了基于区域和以对象为中心的预训练。R2O 训练一个编码器,将基于区域的分割动态细化为以对象为中心的掩码,然后联合学习掩码内内容的表征。R2O 使用“区域细化模块”,通过聚类区域级特征,将使用区域级先验生成的小图像区域分组成更可能对应对象的大区域。随着预训练推进,R2O 遵循区域到对象的课程,早期鼓励学习区域级特征,并逐渐过渡到训练以对象为中心的表征。使用 R2O 学习的表征在 PASCAL VOC 语义分割(+0.7 mIOU)和 Cityscapes(+0.4 mIOU)以及 MS COCO 实例分割(+0.3 mask AP)上取得了最优性能。此外,在 ImageNet 上预训练后,R2O 预训练模型能够在 Caltech-UCSD Birds 200-2011 数据集上无需进一步训练即超越现有的无监督对象分割最优结果(+2.9 mIoU)。我们在 https://github.com/KKallidromitis/r2o 提供了本工作的代码/模型。
引用
@article{arxiv.2208.11821,
title = {Refine and Represent: Region-to-Object Representation Learning},
author = {Akash Gokul and Konstantinos Kallidromitis and Shufan Li and Yusuke Kato and Kazuki Kozuka and Trevor Darrell and Colorado J Reed},
journal= {arXiv preprint arXiv:2208.11821},
year = {2022}
}