面向巴西葡萄牙语文本分类的数据增强方法性能研究
计算与语言
2023-04-07 v1
摘要
在提升机器学习性能的同时增强模型泛化能力,一直是人工智能研究者持续追求的目标。数据增强技术常被用于实现这一目标,且大多数评估都是基于英语语料库进行的。在本文中,我们利用多种现有的数据增强方法,分析它们应用于巴西葡萄牙语语料库的文本分类问题时的性能。结果表明,我们的分析显示使用其中某些技术可带来一些预期的改进;然而,这也提示需要进一步探究语言偏差以及非英语文本数据稀缺性的问题。
引用
@article{arxiv.2304.02785,
title = {Performance of Data Augmentation Methods for Brazilian Portuguese Text Classification},
author = {Marcellus Amadeus and Paulo Branco},
journal= {arXiv preprint arXiv:2304.02785},
year = {2023}
}