中文

人工智能混合训练开发:基于两种混合训练策略的基准测试

机器学习 2025-09-03 v1 人工智能

摘要

合成数据已成为训练人工神经网络(ANN)的成本有效替代方案。然而,合成数据与真实数据之间的差异导致域间差距,进而在应用到真实场景时导致训练得到的ANN表现和泛化性差。已开发出多种策略来弥合这一差距,这些策略将合成数据和真实数据组合,称为混合训练。虽然这些策略已显示可减缓域间差距,但对其在各种任务和架构中的可推广性和鲁棒性进行系统评估仍未充分探索。为解决这一挑战,我们的研究全面分析了三种主流架构和三种不同混合数据集上两种广泛使用的混合训练策略。从这些数据集中,我们抽取包含不同比例合成数据和真实数据的子集,以探讨合成成分和真实成分的影响。本文的发现为优化ANN训练过程中合成数据的使用提供了有价值的见解,旨在增强其鲁棒性和有效性。

关键词

引用

@article{arxiv.2506.24093,
  title  = {Development of Hybrid Artificial Intelligence Training on Real and Synthetic Data: Benchmark on Two Mixed Training Strategies},
  author = {Paul Wachter and Lukas Niehaus and Julius Schöning},
  journal= {arXiv preprint arXiv:2506.24093},
  year   = {2025}
}

备注

21pages, 14 figures, 2 tables