评估 AI 生成反话语的人类似度
计算与语言
2025-01-29 v2
摘要
反话语是针对对滥用或仇恨内容进行的有针对性回应,有效遏制仇恨扩散并促进建设性在线交流。以往研究提出了不同的策略用于自动生成反话语。然而,评估主要关注相关性、表面形式及其他浅层语言特征。本文考察 AI 生成反话语的人类似度,这一影响效果的关键因素。我们实现并评估了多种基于 LLM 的生成策略,发现 AI 生成的反话语与人类撰写的反话语易被简单分类器和人类区分。进一步,我们揭示了其在语言特征、礼貌性和具体性方面的差异。本研究使用的数据集已公开,可供后续研究使用。
引用
@article{arxiv.2410.11007,
title = {Assessing the Human Likeness of AI-Generated Counterspeech},
author = {Xiaoying Song and Sujana Mamidisetty and Eduardo Blanco and Lingzi Hong},
journal= {arXiv preprint arXiv:2410.11007},
year = {2025}
}
备注
Accepted for presentation at the COLING 2025