遵循规则的合成数据——学习中的通用语言
机器学习
2022-09-15 v1
摘要
AI 生成的合成数据可提炼现有数据的通用模式,进而作为原始语义内细粒度代表性且新颖的数据样本被安全共享。本工作中,我们探索将领域专业知识融入数据合成的方法,使统计特性与既有的规则领域知识均得以表征。所得合成数据生成器可被查询任意数量的新样本,随后可作为智能的共同来源,作为人类与机器皆可消费的“学习通用语言”。我们在一个公开数据集上演示该概念,并通过描述性分析以及下游 ML 模型评估其益处。
引用
@article{arxiv.2209.06679,
title = {Rule-adhering synthetic data -- the lingua franca of learning},
author = {Michael Platzer and Ivona Krchova},
journal= {arXiv preprint arXiv:2209.06679},
year = {2022}
}
备注
3 pages, 6 figures, accepted at Small Data workshop at 3rd ACM International Conference on AI in Finance (2022)