音译与码混孟加拉语中的攻击性语言识别
计算与语言
2023-11-28 v1
摘要
在社交媒体中识别攻击性内容对于创建安全的在线社区至关重要。近期的若干研究通过为多种语言构建数据集来解决该问题。本文中,我们探索具有音译与码混文本中的攻击性语言识别,这两种语言现象在多语社会中十分常见,也是 NLP 系统已知的挑战。我们引入 TB-OLID,一个包含 5,000 条人工标注评论的音译孟加拉语攻击性语言数据集。我们在 TB-OLID 上训练并微调机器学习模型,并在该数据集上评估其结果。我们的结果表明,英语预训练的基于 transformer 的模型,如 fBERT 与 HateBERT,在该数据集上取得了最佳性能。
引用
@article{arxiv.2311.15023,
title = {Offensive Language Identification in Transliterated and Code-Mixed Bangla},
author = {Md Nishat Raihan and Umma Hani Tanmoy and Anika Binte Islam and Kai North and Tharindu Ranasinghe and Antonios Anastasopoulos and Marcos Zampieri},
journal= {arXiv preprint arXiv:2311.15023},
year = {2023}
}