中文

BHAAV——用于印地语故事情感分析的文本语料库

计算与语言 2019-10-10 v1

摘要

在本文中,我们介绍了首个也是最大的印地语文本语料库,名为BHAAV(在印地语中意为情感),用于分析作者通过故事中角色所表达、由叙述者/读者感知的情感。该语料库由从230篇不同短篇故事收集的20,304个句子组成,涵盖励志和悬疑等18种体裁。每个句子由三名母语为印地语、且至少接受十年印地语正规教育的标注者标注为愤怒、喜悦、悬念、悲伤和中性五种情感类别之一。我们还讨论了印地语等低资源语言标注中的挑战,并探讨了所提语料库的范围及其可能的用途。我们还对数据集进行了详细分析,并训练了强劲的基线分类器以报告其性能。

关键词

引用

@article{arxiv.1910.04073,
  title  = {BHAAV- A Text Corpus for Emotion Analysis from Hindi Stories},
  author = {Yaman Kumar and Debanjan Mahata and Sagar Aggarwal and Anmol Chugh and Rajat Maheshwari and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:1910.04073},
  year   = {2019}
}