中文

基于代码混合指数的焦点损失在达罗毗荼语系攻击性检测中的应用

计算与语言 2022-05-09 v2 人工智能 机器学习

摘要

在过去十年中,我们见证了由社交媒体平台推动的在线内容的指数级增长。如此规模的数据生成伴随着其中难以估量的攻击性内容这一隐患。识别攻击性内容的复杂性因多模态(图像、语言等)的使用、代码混合语言等因素而加剧。此外,即便经过仔细的攻击性内容采样与标注,攻击性与非攻击性内容之间始终存在显著的类别不平衡。在本文中,我们引入了一种新颖的基于代码混合指数(CMI)的焦点损失,其规避了两个挑战:(1)语言中的代码混合;(2)达罗毗荼语系攻击性检测的类别不平衡问题。我们还将传统的基于点积的分类器替换为基于余弦的分类器,从而带来性能提升。此外,我们使用多语言模型,其有助于跨语言迁移所学特征,以有效作用于低资源语言。同样需注意,我们的模型也能处理混合文字(例如拉丁文字与达罗毗荼-泰米尔文字的使用)的实例。总而言之,我们的模型能够在低资源、类别不平衡、多语言和代码混合的环境下处理攻击性语言检测。

关键词

引用

@article{arxiv.2111.06916,
  title  = {Offense Detection in Dravidian Languages using Code-Mixing Index based Focal Loss},
  author = {Debapriya Tula and Shreyas MS and Viswanatha Reddy and Pranjal Sahu and Sumanth Doddapaneni and Prathyush Potluri and Rohan Sukumaran and Parth Patwa},
  journal= {arXiv preprint arXiv:2111.06916},
  year   = {2022}
}

备注

Accepted for publication at SN Computer Science Journal