马拉地语中攻击性社交媒体帖子的类型与目标预测
计算与语言
2022-11-24 v1 人工智能
计算机与社会
机器学习
社会与信息网络
摘要
社交媒体上攻击性语言的存在非常普遍,促使平台投资于使社区更安全的策略。这包括开发能够识别线上攻击性内容的鲁棒机器学习系统。除少数显著例外,大多数关于自动攻击性语言识别的研究都集中于英语和少数其他高资源语言如法语、德语和西班牙语。在本文中,我们通过处理马拉地语(一种在印度使用的低资源印度-雅利安语言)中的攻击性语言识别来弥补这一缺口。我们引入了马拉地语攻击性语言数据集v.2.0(即MOLD 2.0),并基于该数据集进行了多项实验。MOLD 2.0是MOLD的更大版本,其标注扩展至流行的OLID分类法的B级(类型)和C级(目标)。MOLD 2.0是为马拉地语编制的首个分层攻击性语言数据集,从而为低资源印度-雅利安语言的研究开辟了新途径。最后,我们还引入了SeMOLD,一个按照SOLID中提出的半监督方法标注的更大数据集。
引用
@article{arxiv.2211.12570,
title = {Predicting the Type and Target of Offensive Social Media Posts in Marathi},
author = {Marcos Zampieri and Tharindu Ranasinghe and Mrinal Chaudhari and Saurabh Gaikwad and Prajwal Krishna and Mayuresh Nene and Shrunali Paygude},
journal= {arXiv preprint arXiv:2211.12570},
year = {2022}
}
备注
This is a preprint of an article published in the Journal of Intelligent Information Systems, Springer. The final authenticated version is available online at https://link.springer.com/article/10.1007/s13278-022-00906-8