中文

面向仇恨言论识别的代码混合嵌入的重要性

计算与语言 2024-11-28 v1 机器学习

摘要

代码混合是指在单个句子中使用两种或多种语言的 practice,这在印度等多语言社区中经常发生,因人们常常说多种语言。经典的 NLP 工具是在单语言数据上训练的,面对代码混合数据时会面临挑战。在包含多种语言的句子中提取有意义的信息变得困难,特别是在仇恨言论检测等任务中,这是由于语言变异、文化细微差别和数据稀疏性。为了解决这个问题,我们旨在分析代码混合嵌入的重要性,并评估 BERT 和 HingBERT 模型(在印度旁遮普-英语语料库上训练)在仇恨言论检测中的性能。我们的研究表明,受印度旁遮普-英语数据集 L3Cube-HingCorpus 训练的 HingBERT 模型在仇恨言论文本数据集上 outperform BERT 模型。我们还发现,代码混合 Hing-FastText 的性能优于标准英文 FastText 和 vanilla BERT 模型。

关键词

引用

@article{arxiv.2411.18577,
  title  = {On Importance of Code-Mixed Embeddings for Hate Speech Identification},
  author = {Shruti Jagdale and Omkar Khade and Gauri Takalikar and Mihir Inamdar and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2411.18577},
  year   = {2024}
}