中文

生成人工文本作为训练数据的替代或补充

计算与语言 2021-10-26 v1 信息检索

摘要

随着 Transformer 的出现,人工生成文本的质量已显著提升。自然地产生了利用这些模型为监督学习任务生成学习数据的问题。本文从三个方面探讨该问题:(i)人工数据是否为高效补充?(ii)当原始数据不可用或因保密原因无法分发时,它们能否替代原始数据?(iii)它们能否改进分类器的可解释性?我们在 Web 相关分类任务——即产品评论情感分析与假新闻检测——上使用微调 GPT-2 模型生成的人工数据开展不同实验。结果表明此类人工数据可在一定程度上使用,但需预处理以显著提升性能。我们展示词袋方法从此类数据增强中获益最多。

关键词

引用

@article{arxiv.2110.13016,
  title  = {Generating artificial texts as substitution or complement of training data},
  author = {Vincent Claveau and Antoine Chaffin and Ewa Kijak},
  journal= {arXiv preprint arXiv:2110.13016},
  year   = {2021}
}

备注

8 pages