BHAAV——用于印地语故事情感分析的文本语料库
计算与语言
2019-10-10 v1
摘要
在本文中,我们介绍了首个也是最大的印地语文本语料库,名为BHAAV(在印地语中意为情感),用于分析作者通过故事中角色所表达、由叙述者/读者感知的情感。该语料库由从230篇不同短篇故事收集的20,304个句子组成,涵盖励志和悬疑等18种体裁。每个句子由三名母语为印地语、且至少接受十年印地语正规教育的标注者标注为愤怒、喜悦、悬念、悲伤和中性五种情感类别之一。我们还讨论了印地语等低资源语言标注中的挑战,并探讨了所提语料库的范围及其可能的用途。我们还对数据集进行了详细分析,并训练了强劲的基线分类器以报告其性能。
引用
@article{arxiv.1910.04073,
title = {BHAAV- A Text Corpus for Emotion Analysis from Hindi Stories},
author = {Yaman Kumar and Debanjan Mahata and Sagar Aggarwal and Anmol Chugh and Rajat Maheshwari and Rajiv Ratn Shah},
journal= {arXiv preprint arXiv:1910.04073},
year = {2019}
}