中文

Anubhuti——用于孟加拉语短篇小说情感分析的人工标注数据集

计算与语言 2020-10-08 v1

摘要

当今世界,许多不同语言的数以千计的短篇小说和文章正在被创作出来。孟加拉语(Bangla)是印度仅次于印地语的第二大口语语言,也是孟加拉国的国语。本工作详细报告了 Anubhuti 的构建——这是首个也是最大的用于分析孟加拉语短篇小说作者所表达情感的文本语料库。我们解释了数据收集方法、人工标注过程,以及由于标注者的语言学专业知识和所遵循的清晰标注方法而导致的该数据集的高标注者间一致性。我们也探讨了在像孟加拉语这样的低资源语言原始数据收集和标注过程中面临的一些挑战。我们使用基线机器学习以及深度学习模型对数据集在情感分类上的性能进行了验证,发现这些标准模型在 Anubhuti 上具有较高的准确率和相关的特征选择能力。此外,我们还解释了语言学家和数据分析师如何能够利用该数据集研究孟加拉语文学作者所表达的情感流动。

关键词

引用

@article{arxiv.2010.03065,
  title  = {Anubhuti -- An annotated dataset for emotional analysis of Bengali short stories},
  author = {Aditya Pal and Bhaskar Karn},
  journal= {arXiv preprint arXiv:2010.03065},
  year   = {2020}
}

备注

4 pages, 6 figures