中文

超越隐私:探索合成数据的机遇与挑战

机器学习 2023-04-10 v1

摘要

通过生成模型生成合成数据在机器学习(ML)界及更广范围内正引起关注。过去,合成数据常被视为私有数据发布的一种手段,但近期大量论文探讨其潜力远不止于此——从创建更公平的数据到数据增强,从模拟到由ChatGPT生成的文本。在本视角中,我们探讨合成数据是否及如何能成为机器学习世界的主导力量,有望实现一个数据集可量身定制以满足个体需求的未来。同样重要的是,我们讨论学界需克服哪些根本性挑战以实现合成数据更广泛的关联与应用——其中最重要的是量化我们能多大程度信任从合成数据得出的任何发现或预测。

关键词

引用

@article{arxiv.2304.03722,
  title  = {Beyond Privacy: Navigating the Opportunities and Challenges of Synthetic Data},
  author = {Boris van Breugel and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2304.03722},
  year   = {2023}
}