仅用合成数据:探索语法错误纠正中合成数据的阴暗面
计算与语言
2023-06-27 v1 人工智能
摘要
以数据为中心的 AI 方法旨在不修改模型的情况下提升模型性能,并已被证明对模型性能有正向影响。尽管近期基于合成数据的以数据为中心的 AI 受到了关注,因其具有提升性能的潜力,但以数据为中心的 AI 长期以来仅使用真实世界数据和公开可用的基准数据集进行验证。鉴于此,以数据为中心的 AI 仍高度依赖真实世界数据,而使用合成数据对模型进行验证尚未得到充分开展。针对上述挑战,我们提出如下问题:数据质量控制(噪声注入与平衡数据)这一被誉具有正向影响的以数据为中心的 AI 方法,在仅使用合成数据训练的模型中是否表现出同样的正向影响?为解答该问题,我们基于语法错误纠正(GEC)任务,对合成数据与真实世界数据训练的模型进行了对比分析。实验结果表明,正如现有研究先前所报告的,数据质量控制方法对真实世界数据训练的模型有正向影响,而在仅使用合成数据训练的模型中则观察到负向影响。
引用
@article{arxiv.2306.14377,
title = {Synthetic Alone: Exploring the Dark Side of Synthetic Data for Grammatical Error Correction},
author = {Chanjun Park and Seonmin Koo and Seolhwa Lee and Jaehyung Seo and Sugyeong Eo and Hyeonseok Moon and Heuiseok Lim},
journal= {arXiv preprint arXiv:2306.14377},
year = {2023}
}
备注
Accepted for Data-centric Machine Learning Research (DMLR) Workshop at ICML 2023