基于代码混合指数的焦点损失在达罗毗荼语系攻击性检测中的应用
计算与语言
2022-05-09 v2 人工智能
机器学习
摘要
在过去十年中,我们见证了由社交媒体平台推动的在线内容的指数级增长。如此规模的数据生成伴随着其中难以估量的攻击性内容这一隐患。识别攻击性内容的复杂性因多模态(图像、语言等)的使用、代码混合语言等因素而加剧。此外,即便经过仔细的攻击性内容采样与标注,攻击性与非攻击性内容之间始终存在显著的类别不平衡。在本文中,我们引入了一种新颖的基于代码混合指数(CMI)的焦点损失,其规避了两个挑战:(1)语言中的代码混合;(2)达罗毗荼语系攻击性检测的类别不平衡问题。我们还将传统的基于点积的分类器替换为基于余弦的分类器,从而带来性能提升。此外,我们使用多语言模型,其有助于跨语言迁移所学特征,以有效作用于低资源语言。同样需注意,我们的模型也能处理混合文字(例如拉丁文字与达罗毗荼-泰米尔文字的使用)的实例。总而言之,我们的模型能够在低资源、类别不平衡、多语言和代码混合的环境下处理攻击性语言检测。
引用
@article{arxiv.2111.06916,
title = {Offense Detection in Dravidian Languages using Code-Mixing Index based Focal Loss},
author = {Debapriya Tula and Shreyas MS and Viswanatha Reddy and Pranjal Sahu and Sumanth Doddapaneni and Prathyush Potluri and Rohan Sukumaran and Parth Patwa},
journal= {arXiv preprint arXiv:2111.06916},
year = {2022}
}
备注
Accepted for publication at SN Computer Science Journal