孟加拉语文本数据集及用于在线骚扰检测的探索性分析
计算与语言
2021-02-05 v1 信息检索
摘要
作为世界第七大语言,近年来孟加拉语在网上的使用有所增加。因此,分析孟加拉语文本数据以维护安全且无骚扰的网络空间变得非常重要。本文中提供的已公开数据是从Facebook上名人、政府官员、运动员的公共帖子下人们的评论中收集并标注的。收集的评论总数为44001条。该数据集的编制旨在借助自然语言处理使机器能够区分一条评论是否为欺凌性表达,以及若其为不当评论则其不当程度如何。评论被标注为不同的骚扰类别。本文还包含了从不同视角的探索性分析以给出详细概览。由于分类孟加拉语评论的数据收集稀缺,该数据集可在检测欺凌词、识别不当评论、检测不同类别的孟加拉语欺凌等研究中发挥重要作用。数据集公开于 https://data.mendeley.com/datasets/9xjx8twk8p。
引用
@article{arxiv.2102.02478,
title = {Bangla Text Dataset and Exploratory Analysis for Online Harassment Detection},
author = {Md Faisal Ahmed and Zalish Mahmud and Zarin Tasnim Biash and Ahmed Ann Noor Ryen and Arman Hossain and Faisal Bin Ashraf},
journal= {arXiv preprint arXiv:2102.02478},
year = {2021}
}
备注
3 pages, 5 tables, 6 figures