中文

社交媒体语料上数据增强方法的探索

计算与语言 2023-03-07 v1

摘要

数据增强在计算机视觉中已被广泛证明有效。在自然语言处理(NLP)中,数据增强仍是活跃的研究领域。尚无跨任务和模型架构均表现良好的公认增强技术。本文中,我们在使用两个社交媒体数据集的文本分类背景下探索数据增强技术。我们探索了流行的数据增强变体,从过采样、Easy Data Augmentation (Wei and Zou, 2019) 和 Back-Translation (Sennrich et al., 2015) 开始。我们还考虑了 Greyscaling,一种相对未被探索的试图减轻示例中形容词强度的数据增强技术。最后,我们考虑少样本学习方法:Pattern-Exploiting Training (PET) (Schick et al., 2020)。实验使用 BERT transformer 架构。结果显示增强技术仅提供极小且不一致的提升。同义词替换提供了一些性能提升的证据,而 Grayscaling 的形容词尺度是值得进一步探索的领域。少样本学习实验显示比有监督训练有一致提升,且在类别易分离时似乎很有前景,但进一步探索是有价值的。

关键词

引用

@article{arxiv.2303.02198,
  title  = {Exploring Data Augmentation Methods on Social Media Corpora},
  author = {Isabel Garcia Pietri and Kineret Stanley},
  journal= {arXiv preprint arXiv:2303.02198},
  year   = {2023}
}