论合成数据的等价性、可替代性和灵活性
机器学习
2024-03-26 v1 计算机视觉与模式识别
摘要
我们从实证角度研究了合成数据在真实场景中的有效性。利用合成数据训练感知模型已成为社区采用的关键策略,因其高效、可扩展、完美标注和低成本。尽管有公认的优势,但很少有研究关注如何高效生成合成数据集以解决真实问题,以及合成数据能在多大程度上减少真实数据收集的工作量。为了回答这些问题,我们系统地研究了合成数据的几个有趣特性——合成数据与真实数据的等价性、合成数据对真实数据的可替代性,以及合成数据生成器在缩小域差距方面的灵活性。利用M3Act合成数据生成器,我们在DanceTrack和MOT17上进行了实验。结果表明,合成数据不仅能提升模型性能,而且表现出对真实数据的可替代性,在60%到80%的替换比例下性能无损失。此外,我们对合成数据分布对下游性能影响的研究揭示了灵活数据生成器在缩小域差距以提高模型适应性方面的重要性。
引用
@article{arxiv.2403.16244,
title = {On the Equivalency, Substitutability, and Flexibility of Synthetic Data},
author = {Che-Jui Chang and Danrui Li and Seonghyeon Moon and Mubbasir Kapadia},
journal= {arXiv preprint arXiv:2403.16244},
year = {2024}
}