合成数据的前沿数据治理机会与挑战
计算机与社会
2025-06-03 v2 人工智能
机器学习
摘要
合成数据,或由机器学习模型生成的数据,正日益成为解决数据访问问题的解决方案。然而,其使用引入了显著的治理和问责制挑战,可能损害现有的治理范式,如计算和数据治理。本文识别了合成数据提出的 3 项关键治理和问责制挑战——它可以促进恶意行为者的增加、出现自发性偏见和价值漂移。我们因此构建了 3 项技术机制以解决这些具体挑战,发现其对抗训练、偏见缓解和价值强化等合成数据应用具有意义。这些不仅可以抵消合成数据的风险,还可作为未来前沿治理的关键杠杆。
引用
@article{arxiv.2503.17414,
title = {Opportunities and Challenges of Frontier Data Governance With Synthetic Data},
author = {Madhavendra Thakur and Jason Hausenloy},
journal= {arXiv preprint arXiv:2503.17414},
year = {2025}
}
备注
Published at the ICLR 2025 Workshop on Human-AI Coevolution (HAIC)