审视合成数据在 AI 开发管道中的扩张作用
人机交互
2025-05-14 v2
摘要
随着生成式 AI 的增长,我们正看到合成数据在 AI 开发管道所有阶段的使用激增。现在,研究人员和实践者经常使用一个大型生成模型(我们称为辅助模型)生成用于训练或评估另一个模型的合成数据,从而重新配置 AI 工作流程并重塑数据的本质。尽管学者们对合成数据的风险提出了担忧,但针对其负责任使用的政策指导和最佳实践尚未跟上这些快速演变的行业趋势,这部分因为我们缺乏对当前实践和挑战的清晰认识。我们的工作旨在弥合这一差距。通过对 29 位 AI 实践者和负责任 AI 专家进行访谈,我们审察了合成数据在 AI 开发中的扩张作用。我们的发现揭示了辅助模型在 AI 开发管道中广泛使用的情形。实践者将合成数据描述为解决数据稀缺问题和提供竞争优势的关键手段,他们指出,在没有辅助模型的情况下,对生成式 AI 系统进行大规模评估是不可行的。然而,他们面临着控制辅助模型输出、生成准确描绘少数群体的数据以及扩展主要基于手动检查的数据验证实践的挑战。我们详细阐述了合成数据的一般局限性和伦理考虑,并提出了具体步骤,以制定其负责任使用的实践指南。
引用
@article{arxiv.2501.18493,
title = {Examining the Expanding Role of Synthetic Data Throughout the AI Development Pipeline},
author = {Shivani Kapania and Stephanie Ballard and Alex Kessler and Jennifer Wortman Vaughan},
journal= {arXiv preprint arXiv:2501.18493},
year = {2025}
}