中文

PANDA——来自亚洲的配对仇恨叙事数据集: 使用LLM作为裁判器创建首个中文反仇恨言论数据集

计算与语言 2025-01-07 v2

摘要

尽管现代标准中文在全球范围内广泛使用,但针对中文的反仇恨言论(Counterspeech, CS)资源几乎不存在。为弥补东亚地区反仇恨言论研究的差距,我们引入了一个现代标准普通话反仇恨言论语料库,旨在针对中国大陆的仇恨言论进行斗争。本文提出了一种新颖的方法,通过使用LLM作为裁判器、模拟退火、LLM零-shot中文生成以及轮流算法生成CS,随后进行 manual verification 以确保质量和语境相关性。本文详细阐述了为非欧洲中心语言(包括中文)创建有效反仇恨言论的方法,涵盖特定文化模式(即哪些群体受到污蔑)以及程序性地将哪些话语标记为仇恨言论的语言模式。对生成语料的分析表明,开源、准确标注的中文仇恨言论数据稀缺且使用LLM作为裁判器对中文答案进行评分存在局限性。此外,当前语料库是首个基于东亚语言的CS语料库,为未来研究在反仇恨言论生成与评估方面提供了 essential 资源。

关键词

引用

@article{arxiv.2501.00697,
  title  = {PANDA -- Paired Anti-hate Narratives Dataset from Asia: Using an LLM-as-a-Judge to Create the First Chinese Counterspeech Dataset},
  author = {Michael Bennie and Demi Zhang and Bushi Xiao and Jing Cao and Chryseis Xinyi Liu and Jian Meng and Alayo Tripp},
  journal= {arXiv preprint arXiv:2501.00697},
  year   = {2025}
}

备注

to be published in MCG-COLING 2025's conference proceedings