中文

评估ChatGPT在多语言及基于表情符号的仇恨语音检测中的表现

计算与语言 2023-05-24 v2 机器学习

摘要

仇恨语音是影响许多在线平台的严重问题。迄今为止,已开展若干研究以开发稳健的仇恨语音检测系统。诸如ChatGPT之类的大语言模型近期在包括仇恨语音检测在内的多项任务中展现出巨大潜力。然而,理解这些模型的局限性对于构建稳健的仇恨语音检测系统至关重要。为弥补这一差距,我们的研究旨在评估ChatGPT模型在跨11种语言细粒度检测仇恨语音方面的优势与弱点。我们的评估采用一系列功能性测试,揭示了模型的各种复杂失效模式,而这些是宏F1或准确率等聚合指标无法揭示的。此外,我们研究了复杂情绪(如仇恨语音中表情符号的使用)对ChatGPT模型性能的影响。我们的分析凸显了生成模型在检测某些类型仇恨语音方面的不足,并指出需要对这些模型的工作机制开展进一步研究与改进。

关键词

引用

@article{arxiv.2305.13276,
  title  = {Evaluating ChatGPT's Performance for Multilingual and Emoji-based Hate Speech Detection},
  author = {Mithun Das and Saurabh Kumar Pandey and Animesh Mukherjee},
  journal= {arXiv preprint arXiv:2305.13276},
  year   = {2023}
}