中文

代码混合社交媒体文本上的多语言辱骂性识别

计算与语言 2022-04-06 v1 机器学习 社会与信息网络

摘要

社交媒体平台的使用采纳与增长随时间不断提升。在过去一年的封锁期间,当人们身体上的互动、对话和表达受限时,这一增长进一步加速。为了更好的用户体验,保持平台免受辱骂性内容侵害正变得愈发重要。针对英语社交媒体内容已有很多工作,但非英语社交媒体上的文本分析相对未被充分探索。非英语社交媒体内容还面临代码混合、音译以及在同一句中使用了不同文字等额外挑战。在这项工作中,我们提出了一种针对包含印度语言的多语言Moj数据集的辱骂性识别方法。我们的方法应对了非英语社交媒体内容的常见挑战,并且可扩展至其他语言。

关键词

引用

@article{arxiv.2204.01848,
  title  = {Multilingual Abusiveness Identification on Code-Mixed Social Media Text},
  author = {Ekagra Ranjan and Naman Poddar},
  journal= {arXiv preprint arXiv:2204.01848},
  year   = {2022}
}