中文

SalAngaBhava:用于基于方面的情感分析的僧伽罗语市场数据集

计算与语言 2026-07-06 v1 机器学习

摘要

情感分析从诞生之初就一直是自然语言处理(NLP)下的主要领域,因为它在现实世界和研究应用中扮演着至关重要的角色。在高资源语言中,这又向前迈进了一步,模型不是预测句子级别的情感,而是被开发用于检测方面级别的更细粒度的情感。然而,为了进行这种细粒度的基于方面的情感分析(ABSA),需要带有方面和针对所述方面的情感标注的数据集。对于低资源语言,这样的数据集是缺乏的,其中我们可以列举僧伽罗语,一种主要在斯里兰卡使用的印度-雅利安语言。在这项工作中,我们介绍了SalAngaBhava,一个新的僧伽罗语基于方面的情感分析数据集,其中包含手动标注了方面术语和相关情感(正面、负面、中性)的僧伽罗语产品评论。数据是从领域相关来源(如用户生成的评论和留言)收集的,并按照精心定义的指南进行标注,以确保一致性和质量。该数据集包含句子和方面-情感对,涵盖了来自多个领域的相当广泛的方面。分析证实,该数据集结构良好,对于ABSA研究来说足够平衡。该数据集可用作基准,并促进与僧伽罗语自然语言处理和低资源情感分析任务相关的进一步研究。

关键词

引用

@article{arxiv.2607.05259,
  title  = {SalAngaBhava: A Sinhala Market Dataset for Aspect-based Sentiment Analysis},
  author = {Lakshani Galwatta and Nisansa de Silva and Sarangi Aththanayake and Adithya Galwatta},
  journal= {arXiv preprint arXiv:2607.05259},
  year   = {2026}
}

备注

9 pages, 6 figures