中文

基于数据增强方法的低资源语言鲁棒情感分析:以马拉地语为例

计算与语言 2023-10-03 v1 机器学习

摘要

情感分析在理解文本数据所表达的情感方面起着关键作用。尽管英语及其他西方语言的情感分析研究已广泛开展,但低资源语言的情感分析研究存在显著缺口。包括数据集与 NLP 研究在内的有限资源阻碍了该领域的进展。本文中,我们对低资源印度语言马拉地语的数据增强方法进行了详尽研究。尽管存在马拉地语情感分析的特定领域数据集,但其应用于泛化且变长输入时往往不足。为应对此挑战,本文提出四种马拉地语情感分析的数据增强技术。论文聚焦于增强现有数据集以弥补充足资源的缺乏。主要目标是通过利用数据增强策略,提升领域内与跨领域场景下情感分析模型的性能。所提出的数据增强方法在跨领域准确率上显示出显著性能提升。增强方法包括释义、回译;基于 BERT 的随机词元替换、命名实体替换与伪标签生成;基于 GPT 的文本与标签生成。此外,这些技术可推广至其他低资源语言及通用文本分类任务。

关键词

引用

@article{arxiv.2310.00734,
  title  = {Robust Sentiment Analysis for Low Resource languages Using Data Augmentation Approaches: A Case Study in Marathi},
  author = {Aabha Pingle and Aditya Vyawahare and Isha Joshi and Rahul Tangsali and Geetanjali Kale and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2310.00734},
  year   = {2023}
}