中文

音译与码混孟加拉语中的攻击性语言识别

计算与语言 2023-11-28 v1

摘要

在社交媒体中识别攻击性内容对于创建安全的在线社区至关重要。近期的若干研究通过为多种语言构建数据集来解决该问题。本文中,我们探索具有音译与码混文本中的攻击性语言识别,这两种语言现象在多语社会中十分常见,也是 NLP 系统已知的挑战。我们引入 TB-OLID,一个包含 5,000 条人工标注评论的音译孟加拉语攻击性语言数据集。我们在 TB-OLID 上训练并微调机器学习模型,并在该数据集上评估其结果。我们的结果表明,英语预训练的基于 transformer 的模型,如 fBERT 与 HateBERT,在该数据集上取得了最佳性能。

关键词

引用

@article{arxiv.2311.15023,
  title  = {Offensive Language Identification in Transliterated and Code-Mixed Bangla},
  author = {Md Nishat Raihan and Umma Hani Tanmoy and Anika Binte Islam and Kai North and Tharindu Ranasinghe and Antonios Anastasopoulos and Marcos Zampieri},
  journal= {arXiv preprint arXiv:2311.15023},
  year   = {2023}
}