中文

EmoInHindi:面向对话中情感识别的印地语多标签情感与强度标注数据集

计算与语言 2022-05-30 v1

摘要

人工智能(AI)的长期目标是创建类人对话系统。此类系统应具备与用户建立情感连接的能力,因此对话中的情感识别是一项重要任务。对话中的情感检测是一项具有挑战性的任务,因为人类通常在单一话语中传达多种不同强度的情感。此外,对话中某话语的情感可能依赖于先前话语,使任务更为复杂。情感识别一直需求巨大。然而,现有多数用于对话中多标签情感与强度检测的数据集均为英文。为此,我们创建了一个名为 EmoInHindi 的大型印地语对话数据集,用于对话中的多标签情感与强度识别,包含 1,814 段对话共计 44,247 条话语。我们以 Wizard-of-Oz 方式为犯罪受害者的心理健康与法律咨询构建数据集。对话的每条话语均标注了来自 16 个情感类别(含中性)中的一种或多种情感类别及其对应强度值。我们进一步提出了强上下文基线,可在给定对话上下文时检测话语的情感及其对应强度。

关键词

引用

@article{arxiv.2205.13908,
  title  = {EmoInHindi: A Multi-label Emotion and Intensity Annotated Dataset in Hindi for Emotion Recognition in Dialogues},
  author = {Gopendra Vikram Singh and Priyanshu Priya and Mauajama Firdaus and Asif Ekbal and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2205.13908},
  year   = {2022}
}

备注

This paper is accepted at LREC 2022