中文

促进合成数据在受监管领域的应用

机器学习 2022-04-14 v1 人工智能 机器学习

摘要

从以模型为中心到以数据为中心的思维转变,将重点放在数据及其质量而非算法上,带来了新的挑战。特别是,在高度受监管场景中信息的敏感性需要被考虑。为解决隐私问题已开发出特定方法,如隐私增强技术(Privacy Enhancing Technologies)。然而,它们常导致信息损失,提出了数据质量与隐私之间关键的权衡。绕过这一难题的巧妙方法依赖于合成数据:从生成过程中学习真实数据属性得到的数据。学术界与工业界都意识到评估合成数据质量的重要性:若无全面可靠的度量指标,创新的数据生成任务便没有恰当的待最大化目标函数。尽管如此,该主题仍未被充分探索。为此,我们系统编目了合成数据质量与隐私的重要特征,并设计了专门的测试方法。成果是 DAISYnt(Artificial Intelligence SYnthesis 的采用,aDoption of Artificial Intelligence SYnthesis):一套综合的先进测试套件,为合成数据评估确立了事实标准。作为一个实际用例,多种生成算法已在真实世界征信局数据上训练。最佳模型使用 DAISYnt 在不同合成副本上进行了评估。其他潜在用途包括生成模型的审计与微调,或确保给定合成数据集的高质量。从规范角度看,最终 DAISYnt 可能为从金融到医疗,经由保险与教育的高度受监管领域中的合成数据采用铺平道路。

关键词

引用

@article{arxiv.2204.06297,
  title  = {Enabling Synthetic Data adoption in regulated domains},
  author = {Giorgio Visani and Giacomo Graffi and Mattia Alfero and Enrico Bagli and Davide Capuzzo and Federico Chesani},
  journal= {arXiv preprint arXiv:2204.06297},
  year   = {2022}
}