中文

数据合成方法综述

机器学习 2024-07-08 v1 人工智能

摘要

本文对合成数据技术进行详细综述。我们首先讨论使用合成数据进行数据增强的预期目标,这可以分为四个方面:1)提高多样性,2)数据平衡,3)解决领域迁移问题,以及4)解决边缘案例问题。合成数据的制作与当主流机器学习技术紧密相关,因此,我们将合成数据技术概括为四个类别:1)基于专家知识,2)直接训练,3)预训练后微调,以及4)无需微调的基础模型。接下来,我们讨论合成数据过滤的目标,并将其分为四种类型:1)基本质量,2)标签一致性,3)数据分布。本文第5节还讨论了合成数据的未来方向,并指出我们认为重要的三个方向:1)更关注质量,2)合成数据的评估,以及3)多模型数据增强。

关键词

引用

@article{arxiv.2407.03672,
  title  = {A Survey of Data Synthesis Approaches},
  author = {Hsin-Yu Chang and Pei-Yu Chen and Tun-Hsiang Chou and Chang-Sheng Kao and Hsuan-Yun Yu and Yen-Ting Lin and Yun-Nung Chen},
  journal= {arXiv preprint arXiv:2407.03672},
  year   = {2024}
}