语义分割无训练合成数据选择方法
计算机视觉与模式识别
2025-01-28 v1
摘要
使用合成数据训练语义分割模型正受到广泛关注,因为其获取便利且数量庞大。大多数先前方法聚焦于生成大规模的合成图像-标注样本,然后训练分割模型。然而,这种方法仍面临主要挑战——质量较差的样本不可避免,且使用这些样本训练模型会损害训练过程。本文提出一种基于 CLIP 的训练-free Synthetic Data Selection(SDS)策略,用于选择高质量样本以构建可靠的合成数据集。具体而言,给定大量合成图像-标注对,我们首先设计一种基于扰动的 CLIP 相似度(PCS)来衡量合成图像的可靠性,从而移除质量较差的图像样本。随后,我们提出一种类别平衡标注相似度过滤器(ASF),通过比较合成标注与 CLIP 的响应来移除与质量较差标注相关的样本。实验结果表明,我们的方法显著减少了数据规模的一半,同时训练得到的分割模型达到更高的性能。代码已发布于 https://github.com/tanghao2000/SDS。
引用
@article{arxiv.2501.15201,
title = {A Training-free Synthetic Data Selection Method for Semantic Segmentation},
author = {Hao Tang and Siyue Yu and Jian Pang and Bingfeng Zhang},
journal= {arXiv preprint arXiv:2501.15201},
year = {2025}
}
备注
Accepted to AAAI 2025