基于视觉引导图像合成的频率之外无偏目标检测
计算机视觉与模式识别
2026-03-18 v3
摘要
本文提出一种基于生成的去偏框架用于目标检测。先前的去偏方法常受样本表示多样性限制,而简单的数据生成增强往往保留其试图解决的偏差。此外,我们的分析揭示,仅为稀有类别生成更多数据并非最优方案,原因在于:i) 实例频率是模型真实数据需求的不完整指标,ii) 当前布局到图像合成缺乏足够的保真度和控制来生成高质量、复杂场景。为克服此问题,我们引入表示得分 (RS) 来诊断频率之外的表示差距,引导创建新的无偏布局。为确保高质量合成,我们用精确的视觉蓝图取代模糊的文本提示,并采用生成对齐策略,促进检测器与生成器之间的沟通。我们的方法显著缩小了底层对象组的性能差距,例如在大尺寸/稀有实例上分别提高 4.4/3.6 mAP,超过先前的布局到图像 (L2I) 合成模型 15.9 mAP 的布局准确度。
引用
@article{arxiv.2510.18229,
title = {Unbiased Object Detection Beyond Frequency with Visually Prompted Image Synthesis},
author = {Xinhao Cai and Liulei Li and Gensheng Pei and Tao Chen and Jinshan Pan and Yazhou Yao and Wenguan Wang},
journal= {arXiv preprint arXiv:2510.18229},
year = {2026}
}
备注
Accepted by ICLR2026