Siamese DETR
计算机视觉与模式识别
2023-04-03 v1
摘要
近期的自监督方法主要为基模型(如 ResNets 或 ViTs)的表示学习而设计。它们不易迁移到 DETR,因其具有任务特定的 Transformer 模块。本工作中,我们提出 Siamese DETR,一种面向 DETR 中 Transformer 架构的孪生自监督预训练方法。我们考虑在一个新颖的多视图学习框架中,通过两个互补任务(即定位与判别)同时学习视图不变且面向检测的表示。设计了两个自监督 pretext 任务:(i) 多视图区域检测旨在学习定位输入增强视图之间的感兴趣区域;(ii) 多视图语义判别试图改进每个区域的对象级判别。所提出的 Siamese DETR 在使用不同 DETR 变体的所有设定下,于 COCO 和 PASCAL VOC 检测上取得了最先进的迁移性能。代码见 https://github.com/Zx55/SiameseDETR。
引用
@article{arxiv.2303.18144,
title = {Siamese DETR},
author = {Zeren Chen and Gengshi Huang and Wei Li and Jianing Teng and Kun Wang and Jing Shao and Chen Change Loy and Lu Sheng},
journal= {arXiv preprint arXiv:2303.18144},
year = {2023}
}
备注
10 pages, 11 figures. Accepted in CVPR 2023