中文

有限数据情境下数据增强评估协议探析

计算与语言 2024-09-18 v2 人工智能 机器学习

摘要

文本数据增强(DA)是一项研究新方法以创建人工数据的活跃领域,已在小数据场景下(至少对于文本分类任务)显示出显著效率。本文挑战了这些结果,表明经典数据增强(即修改句子)实际上只是一种更好地进行微调手段,而在应用数据增强之前投入更多时间进行微调则会消除其效果。这一发现具有重要意义,因为它解答了近年来留下的几个问题,包括:哪种 DA 技术最有效(只要生成的数据足够接近训练集,以免影响训练,所有技术都可行),以及 DA 为什么显示出积极结果(促进网络训练)。我们进一步表明,零样本和少样本 DA 通过诉求型代理人如 ChatGPT 或 LLama2 可提升性能,这种形式的数据增强优于经典方法。

关键词

引用

@article{arxiv.2402.14895,
  title  = {On Evaluation Protocols for Data Augmentation in a Limited Data Scenario},
  author = {Frédéric Piedboeuf and Philippe Langlais},
  journal= {arXiv preprint arXiv:2402.14895},
  year   = {2024}
}

备注

8 pages