中文

使用合成图像对计算机视觉训练的影响

计算机视觉与模式识别 2025-06-05 v1

摘要

本文探讨了如何利用渲染引擎(如 Unreal Engine 4, UE)创建合成图像,以补充深度学习计算机视觉(CV)模型在图像丰富和图像稀缺场景中的数据集。使用来自 UE 的渲染合成图像可为开发人员和企业提供一种获取近乎无限、可重复、灵活且廉价训练集的方法,而无需担心来自互联网的受污染图像或获取它们的成本。通过在两个不同规模的 CV 模型上测试两种二元分类案例(猫 vs 狗和焊接缺陷检测)中的模型测试准确率变化来检验这些生成图像的有效性。此外,本文提供了如何使用预训练 CV 模型作为审判员来衡量合成图像质量的实现方法。结果表明,对于大型(VGG16)和小型(MobileNetV3-small)参数的深度 CV 模型,在模型训练期间添加 >60% 的额外合成图像可将测试-训练准确率差距缩小至约 1-2%,且对仅使用真实世界图像时的测试准确率几乎没有决定性影响。同样,向仅包含合成图像的训练集中添加 <10% 的额外真实训练图像可将分类错误率减半,然后进一步减小。对于所测试的这些案例,使用来自渲染引擎的合成图像使研究人员在训练时只需使用 10% 的真实图像,即可实现与传统方法(50-70%)相当的效果。这项研究为如何创建合成图像、如何使用这些图像、潜在限制以及数据稀缺项目的潜在性能提升提供了示例。

关键词

引用

@article{arxiv.2506.03449,
  title  = {The effects of using created synthetic images in computer vision training},
  author = {John W. Smutny},
  journal= {arXiv preprint arXiv:2506.03449},
  year   = {2025}
}

备注

Nine pages long. Main content in pages one through eight. References start at page nine