OffMix-3L:用于攻击性语言识别的孟加拉语-英语-印地语三语码混数据集
计算与语言
2023-11-28 v2 人工智能
摘要
码混是一种在文本或语音中混合两种或更多语言已被充分研究的语言现象。已有若干工作致力于构建数据集并对码混数据执行下游NLP任务。尽管观察到三种或更多语言的码混并不罕见,该领域大多数可用数据集仅包含来自两种语言的码混数据。在本文中,我们引入OffMix-3L,一个新颖的攻击性语言识别数据集,包含来自三种不同语言的码混数据。我们在该数据集上试验了若干模型,并观察到BanglishBERT优于其他基于transformer的模型与GPT-3.5。
引用
@article{arxiv.2310.18387,
title = {OffMix-3L: A Novel Code-Mixed Dataset in Bangla-English-Hindi for Offensive Language Identification},
author = {Dhiman Goswami and Md Nishat Raihan and Antara Mahmud and Antonios Anastasopoulos and Marcos Zampieri},
journal= {arXiv preprint arXiv:2310.18387},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2310.18023