DravidianMultiModality:用于泰米尔语和马来亚拉姆语多模态情感分析的数据集
计算与语言
2021-06-10 v1
摘要
人类交流本质上是多模态且异步的。分析人类情感与情绪是人工智能中一个新兴的领域。我们在社交媒体上看到越来越多关于产品及其他话题的本地语言多模态内容。然而,对于资源匮乏的达罗毗荼语系语言,可用的多模态资源并不多。我们的研究旨在为资源匮乏的泰米尔语和马来亚拉姆语创建多模态情感分析数据集。首先,我们从 YouTube 下载了泰米尔语和马来亚拉姆语的产品或电影评论视频。接着,我们在标注者的帮助下为视频创建了字幕。然后我们对视频进行情感标注,并使用 Fleiss's Kappa 验证了标注者间一致性。这是由志愿标注者创建的首个泰米尔语和马来亚拉姆语多模态情感分析数据集。
引用
@article{arxiv.2106.04853,
title = {DravidianMultiModality: A Dataset for Multi-modal Sentiment Analysis in Tamil and Malayalam},
author = {Bharathi Raja Chakravarthi and Jishnu Parameswaran P. K and Premjith B and K. P Soman and Rahul Ponnusamy and Prasanna Kumar Kumaresan and Kingston Pal Thamburaj and John P. McCrae},
journal= {arXiv preprint arXiv:2106.04853},
year = {2021}
}
备注
31