中文

基于Transformer方法的混合代码文本上下文仇恨言论检测

计算与语言 2021-11-02 v2 机器学习

摘要

近年来,社交媒体平台帮助人们与更广泛的受众建立联系和交流。但这也导致了网络欺凌的急剧增加。必须检测并遏制仇恨言论,以维护社交媒体平台的健康。此外,包含多种语言的混合代码文本在这些平台上被频繁使用。因此,我们提出了从抓取的Twitter数据中检测混合代码文本仇恨言论的自动化技术。我们特别关注英-印混合代码文本和基于Transformer的方法。虽然常规方法独立分析文本,但我们也利用了父推文形式的内容文本。我们尝试评估多语言BERT和Indic-BERT在单编码器和双编码器设置下的性能。第一种方法使用分隔符连接目标文本和上下文文本,并从BERT模型获取单一表示。第二种方法使用双BERT编码器独立编码两段文本,并对相应的表示取平均。我们表明,使用独立表示的双编码器方法产生了更好的性能。我们还采用了简单的集成方法以进一步提升性能。使用这些方法,我们在HASOC 2021 ICHCL混合代码数据集上报告了73.07%的最佳F1分数。

关键词

引用

@article{arxiv.2110.09338,
  title  = {Contextual Hate Speech Detection in Code Mixed Text using Transformer Based Approaches},
  author = {Ravindra Nayak and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2110.09338},
  year   = {2021}
}

备注

Accepted at HASOC @Forum for Information Retrieval Evaluation(FIRE) 2021