一种用于多语言攻击性语言识别的文本到文本模型
计算与语言
2023-12-07 v1
摘要
社交媒体上攻击性内容的普遍存在正日益成为企业和政府组织关注的问题。最近,基于Transformer的模型如BERT、XLNET和XLM-R在各种攻击性内容(例如仇恨言论、网络欺凌和网络攻击)检测中取得了最先进的性能。然而,由于这些模型仅编码器的架构限制了下游任务中标签的数量和类型,它们大多数能力受限。为解决这些限制,本研究提出了首个用于攻击性语言识别的预训练编码器-解码器架构文本到文本Transformer(T5)模型,该模型在两个大型攻击性语言识别数据集SOLID和CCTK上训练。我们研究了在T5重新训练步骤中结合两个数据集并在SOLID的半监督实例中选择最优阈值的有效性。我们的预训练T5模型在多个英语基准上优于其他为攻击性语言检测微调的基于Transformer的模型,如fBERT和HateBERT。遵循类似方法,我们还使用mT5训练了首个用于攻击性语言识别的多语言预训练模型,并在六种不同语言(德语、印地语、韩语、马拉地语、僧伽罗语和西班牙语)的集合上评估了其性能。结果表明,该多语言模型在上述所有数据集上达到了新的最先进水平,显示了其在多语言场景中的实用性。我们提出的基于T5的模型将免费提供给社区。
引用
@article{arxiv.2312.03379,
title = {A Text-to-Text Model for Multilingual Offensive Language Identification},
author = {Tharindu Ranasinghe and Marcos Zampieri},
journal= {arXiv preprint arXiv:2312.03379},
year = {2023}
}
备注
Accepted to Findings of IJCNLP-AACL 2023