代码混合社交媒体文本上的多语言辱骂性识别
计算与语言
2022-04-06 v1 机器学习
社会与信息网络
摘要
社交媒体平台的使用采纳与增长随时间不断提升。在过去一年的封锁期间,当人们身体上的互动、对话和表达受限时,这一增长进一步加速。为了更好的用户体验,保持平台免受辱骂性内容侵害正变得愈发重要。针对英语社交媒体内容已有很多工作,但非英语社交媒体上的文本分析相对未被充分探索。非英语社交媒体内容还面临代码混合、音译以及在同一句中使用了不同文字等额外挑战。在这项工作中,我们提出了一种针对包含印度语言的多语言Moj数据集的辱骂性识别方法。我们的方法应对了非英语社交媒体内容的常见挑战,并且可扩展至其他语言。
引用
@article{arxiv.2204.01848,
title = {Multilingual Abusiveness Identification on Code-Mixed Social Media Text},
author = {Ekagra Ranjan and Naman Poddar},
journal= {arXiv preprint arXiv:2204.01848},
year = {2022}
}