中文

BanglaSarc:一个用于讽刺检测的数据集

计算与语言 2022-09-28 v1 人工智能

摘要

作为世界上使用最广泛的语言之一,孟加拉语在社交媒体世界中的使用也在增加。讽刺是一种带有潜在负面动机的正面陈述或评论,在当今社交媒体平台上被广泛使用。多年来英语讽刺检测已有显著改进,但孟加拉语讽刺检测的状况仍无变化。因此,识别孟加拉语中的讽刺仍然困难,而缺乏高质量数据是一个主要因素。本文提出BanglaSarc,一个专门为孟加拉语文本数据讽刺检测构建的数据集。该数据集包含从Facebook、YouTube等各种在线社交平台以及若干在线博客收集的5112条评论/状态和内容。由于孟加拉语分类评论的数据收集有限,该数据集将有助于研究识别讽刺、识别人们情绪、检测各类孟加拉语表达及其他领域。该数据集公开于https://www.kaggle.com/datasets/sakibapon/banglasarc。

关键词

引用

@article{arxiv.2209.13461,
  title  = {BanglaSarc: A Dataset for Sarcasm Detection},
  author = {Tasnim Sakib Apon and Ramisa Anan and Elizabeth Antora Modhu and Arjun Suter and Ifrit Jamal Sneha and MD. Golam Rabiul Alam},
  journal= {arXiv preprint arXiv:2209.13461},
  year   = {2022}
}