中文

面向印度多语言社交媒体内容的毒性检测

计算与语言 2022-01-04 v1

摘要

毒性内容是当今社交媒体平台最严重的问题之一。仅印度在2020年就有5.18亿社交媒体用户。为了给内容创作者及其受众提供良好体验,标记毒性评论及发布者至关重要。但重大挑战在于以低资源印度语言识别毒性,因为同一文本存在多种表示形式。此外,社交媒体上的帖子/评论不遵循特定格式、语法或句子结构;这使得多语言社交媒体平台的滥用检测任务更具挑战性。本文描述了'Moj Masti'团队使用ShareChat/Moj在IIIT-D多语言滥用评论识别挑战中提供的数据所提出的系统。我们聚焦于如何利用基于多语言Transformer的预训练与微调模型来处理码混合/码切换分类任务。我们性能最佳的系统是XLM-RoBERTa与MuRIL的集成,在测试数据/排行榜上取得了0.9的平均F-1分数。我们还观察到通过添加音译数据性能有所提升。此外,使用弱元数据、集成与一些后处理技术提升了系统性能,从而使我们在排行榜上位居第一。

关键词

引用

@article{arxiv.2201.00598,
  title  = {Toxicity Detection for Indic Multilingual Social Media Content},
  author = {Manan Jhaveri and Devanshu Ramaiya and Harveen Singh Chadha},
  journal= {arXiv preprint arXiv:2201.00598},
  year   = {2022}
}

备注

It was meant for IEEE BigM conference