跨域少样本目标检测的生成增强迭代伪标签方法
计算机视觉与模式识别
2026-05-29 v1 人工智能
摘要
视觉语言基础模型在跨域少样本目标检测(CD-FSOD)中显示出有前景的零样本泛化能力,但在微调过程中面临两个关键挑战:由于稀疏的单实例标注,支持集利用不足;在极其有限的目标域样本下严重过拟合。为此,本文提出了 GiPL,一个高效的双分支训练框架。在第一个分支中,我们设计了迭代伪标签自训练范式,对支持集进行零样本推理以生成可靠的伪标注,将其与真实标签融合,并迭代优化模型以充分利用支持集数据。在第二个分支中,我们引入基于大型视觉语言模型的生成数据增强管道,合成与域对齐的、多目标标注的图像以丰富训练样本并抑制过拟合。在三个具有挑战性的 CD-FSOD 数据集(RUOD、CARPK、CarDD)上的 1/5/10-shot 设置实验表明,GiPL 在实际中持续优于现有方法,实现显著的性能提升。代码可在 \href{https://github.com/z-yaz/CDiscover}{CDiscover} 获取。
引用
@article{arxiv.2605.29539,
title = {GiPL: Generative augmented iterative Pseudo-Labeling for Cross-Domain Few-Shot Object Detection},
author = {Jiacong Liu and Shu Luo and Yikai Qin and Yaze Zhao and Yongwei Jiang and Yixiong Zou},
journal= {arXiv preprint arXiv:2605.29539},
year = {2026}
}
备注
CVPR 2026 Workshop