通过预测语言模式实现语言无关的代码混合数据增强
计算与语言
2022-11-15 v1
摘要
在这项工作中,我们关注句内代码混合,并提出了几种不同的合成代码混合(SCM)数据增强方法,在各种规模的标注黄金数据下,在下游情感分析任务上优于基线。最重要的是,我们提出的方法表明,用恒定掩码策略性地替换矩阵语言中句子的部分,能显著提升分类准确率,从而激发对代码混合现象的进一步语言学洞察。我们在多种低资源与跨语言设定下测试了我们的数据增强方法,在极度稀缺的英语-马来alam数据集上取得了高达7.73%的相对提升。我们得出结论:代码混合句子中的语码转换模式对模型学习同样重要。最后,我们提出了一种语言无关的SCM算法,其成本低廉却对低资源语言极有帮助。
引用
@article{arxiv.2211.07628,
title = {Language Agnostic Code-Mixing Data Augmentation by Predicting Linguistic Patterns},
author = {Shuyue Stella Li and Kenton Murray},
journal= {arXiv preprint arXiv:2211.07628},
year = {2022}
}
备注
12 pages, 5 figures