中文

资源匮乏的卡纳达语中的希望语音检测

计算与语言 2021-12-07 v2

摘要

近年来,人们开发了众多方法,通过消除社交媒体平台上的粗俗、冒犯性和激烈评论来监控负面情绪的传播。然而,相对较少的研究关注于在在线论坛中接纳积极情绪、强化支持性和令人安心的内容。因此,我们提出创建一个英语-卡纳达语希望语音数据集 KanHope,并进行若干对比实验以对该数据集进行基准测试。该数据集包含 6,176 条从 YouTube 上抓取的卡纳达语码混用户生成评论,并被手动标注为包含希望语音或非希望语音。此外,我们引入了 DC-BERT4HOPE,这是一种双通道模型,利用 KanHope 的英文翻译进行额外训练,以促进希望语音检测。该方法获得了 0.756 的加权 F1 分数,优于其他模型。此后,KanHope 旨在激发卡纳达语相关研究,同时广泛鼓励研究人员对鼓励、积极和支持性的在线内容采取务实态度。

关键词

引用

@article{arxiv.2108.04616,
  title  = {Hope Speech detection in under-resourced Kannada language},
  author = {Adeep Hande and Ruba Priyadharshini and Anbukkarasi Sampath and Kingston Pal Thamburaj and Prabakaran Chandran and Bharathi Raja Chakravarthi},
  journal= {arXiv preprint arXiv:2108.04616},
  year   = {2021}
}