少数伪善者:在线气候变化辩论中伪善指控检测的少样本学习与子类型定义
计算与语言
2024-09-26 v1
摘要
气候危机是在线讨论中的突出问题,而伪善指控是这些辩论中的核心修辞元素。然而,对于大规模文本分析而言,伪善指控检测是一个研究不足的工具,通常被定义为谬误论证检测的一个较小子任务。在本文中,我们将伪善指控检测定义为 NLP 中的一项独立任务,并识别出伪善指控的不同相关子类型。我们的气候变化伪善指控语料库(CHAC)包含 420 条 Reddit 气候辩论评论,由专家标注为两种不同类型的伪善指控:个人伪善与政治伪善。我们评估了使用 6 个样本的少样本上下文学习以及 3 个指令微调的大型语言模型(LLMs)在该数据集上检测伪善指控的表现。结果表明,GPT-4o 和 Llama-3 模型在检测伪善指控方面表现出色(F1 达到 0.68,而先前工作的 F1 为 0.44)。然而,对于伪善指控这样复杂的语义概念,上下文至关重要,我们发现与个人道德伪善相比,模型在识别政治伪善指控时尤为困难。我们的研究为伪善检测和气候变化话语提供了新见解,并为在线气候辩论中伪善指控的大规模分析奠定了基础。
引用
@article{arxiv.2409.16807,
title = {A Few Hypocrites: Few-Shot Learning and Subtype Definitions for Detecting Hypocrisy Accusations in Online Climate Change Debates},
author = {Paulina Garcia Corral and Avishai Green and Hendrik Meyer and Anke Stoll and Xiaoyue Yan and Myrthe Reuver},
journal= {arXiv preprint arXiv:2409.16807},
year = {2024}
}
备注
cite the public version, published at CPSS 2024 @ KONVENS