ReCon:基于纠正与对齐的可区域控制数据增强用于目标检测
计算机视觉与模式识别
2025-10-20 v1
摘要
数据集的规模和质量对训练稳健感知模型至关重要。然而获取大规模标注数据既昂贵又耗时。生成模型已成为通过合成符合所需分布的样本来进行数据增强的强大工具。然而,当前的生成方法往往依赖复杂的后处理或在大型数据集上进行 extensive 微调才能获得满意结果,同时容易出现内容-位置不匹配和语义泄漏。为克服这些限制,我们引入 ReCon,一种新型增强框架,提升基于结构可控生成模型的能力,用于目标检测。ReCon 将区域导向的纠正集成到扩散采样过程中,使用预训练感知模型的反馈来纠正扩散采样过程中生成的错误区域。我们进一步提出区域对齐交叉注意力,以强制实现图像区域与其文本提示之间的空间-语义对齐,从而提高语义一致性和整体图像保真度。广泛实验表明,ReCon 在显著提升生成数据的质量和可训练性方面取得显著成果,在各种数据集、骨干网络和数据规模上实现持续的性能提升。我们的代码可在 https://github.com/haoweiz23/ReCon 获取。
引用
@article{arxiv.2510.15783,
title = {ReCon: Region-Controllable Data Augmentation with Rectification and Alignment for Object Detection},
author = {Haowei Zhu and Tianxiang Pan and Rui Qin and Jun-Hai Yong and Bin Wang},
journal= {arXiv preprint arXiv:2510.15783},
year = {2025}
}
备注
Accepted to NeurIPS 2025 (spotlight)