评估 GPT-3 生成的仇恨内容审核解释
计算与语言
2023-08-31 v4 人工智能
摘要
近期研究聚焦于使用大语言模型(LLM)通过微调或提示生成仇恨言论的解释。尽管该领域兴趣日增,这些生成解释的有效性与潜在局限仍知之甚少。一个关键担忧是,由 LLM 生成的解释可能导致用户与内容审核员对标记内容的性质做出错误判断。例如,LLM 生成的解释可能不准确地说服内容审核员某无害内容为仇恨内容。有鉴于此,我们提出一个用于审视仇恨言论解释的分析框架,并开展了评估此类解释的广泛调查。具体而言,我们提示 GPT-3 为仇恨与非仇恨内容生成解释,并开展了一项有 2400 名独立受访者参与的调查来评估所生成的解释。我们的发现揭示:(1) 人类评估者从语言流畅性、信息量、说服力和逻辑合理性角度将 GPT 生成的解释评为高质量;(2) 然而,这些解释的说服特性随所用提示策略不同而变异;(3) 此种说服力可能导致对内容是否仇恨的错误判断。我们的研究强调了在内容审核中应用 LLM 生成解释需谨慎。代码与结果见 https://github.com/Social-AI-Studio/GPT3-HateEval。
引用
@article{arxiv.2305.17680,
title = {Evaluating GPT-3 Generated Explanations for Hateful Content Moderation},
author = {Han Wang and Ming Shan Hee and Md Rabiul Awal and Kenny Tsu Wei Choo and Roy Ka-Wei Lee},
journal= {arXiv preprint arXiv:2305.17680},
year = {2023}
}
备注
9 pages, 2 figures, Accepted by International Joint Conference on Artificial Intelligence(IJCAI)