PANDA——来自亚洲的配对仇恨叙事数据集: 使用LLM作为裁判器创建首个中文反仇恨言论数据集
计算与语言
2025-01-07 v2
摘要
尽管现代标准中文在全球范围内广泛使用,但针对中文的反仇恨言论(Counterspeech, CS)资源几乎不存在。为弥补东亚地区反仇恨言论研究的差距,我们引入了一个现代标准普通话反仇恨言论语料库,旨在针对中国大陆的仇恨言论进行斗争。本文提出了一种新颖的方法,通过使用LLM作为裁判器、模拟退火、LLM零-shot中文生成以及轮流算法生成CS,随后进行 manual verification 以确保质量和语境相关性。本文详细阐述了为非欧洲中心语言(包括中文)创建有效反仇恨言论的方法,涵盖特定文化模式(即哪些群体受到污蔑)以及程序性地将哪些话语标记为仇恨言论的语言模式。对生成语料的分析表明,开源、准确标注的中文仇恨言论数据稀缺且使用LLM作为裁判器对中文答案进行评分存在局限性。此外,当前语料库是首个基于东亚语言的CS语料库,为未来研究在反仇恨言论生成与评估方面提供了 essential 资源。
引用
@article{arxiv.2501.00697,
title = {PANDA -- Paired Anti-hate Narratives Dataset from Asia: Using an LLM-as-a-Judge to Create the First Chinese Counterspeech Dataset},
author = {Michael Bennie and Demi Zhang and Bushi Xiao and Jing Cao and Chryseis Xinyi Liu and Jian Meng and Alayo Tripp},
journal= {arXiv preprint arXiv:2501.00697},
year = {2025}
}
备注
to be published in MCG-COLING 2025's conference proceedings