从大语言模型中蒸馏知识:一种用于仇恨与反制言论识别的概念瓶颈模型
计算与语言
2025-08-13 v1 人工智能
机器学习
摘要
社交媒体上仇恨言论的迅速增长对社会产生了前所未有的影响,使得检测此类内容的自动化方法变得至关重要。与先前的黑箱模型不同,我们提出了一种新颖的透明方法,即“言论概念瓶颈模型”(SCBM),用于自动化仇恨与反制言论识别,该方法使用形容词作为人类可解释的瓶颈概念。SCBM 利用大语言模型(LLM)将输入文本映射到基于形容词的抽象表示,然后将其送入轻量级分类器进行下游任务。在涵盖多种语言和平台(如 Twitter、Reddit、YouTube)的五个基准数据集上,SCBM 取得了 0.69 的平均宏 F1 分数,在五个数据集中的四个上优于文献中最新报告的结果。除了高识别准确率外,SCBM 还提供了高水平的局部和全局可解释性。此外,将我们基于形容词的概念表示与 Transformer 嵌入相融合,在所有数据集上平均带来了 1.8% 的性能提升,表明所提出的表示捕获了互补信息。我们的结果表明,基于形容词的概念表示可以作为仇恨与反制言论识别中紧凑、可解释且有效的编码。通过调整形容词,我们的方法也可应用于其他 NLP 任务。
引用
@article{arxiv.2508.08274,
title = {Distilling Knowledge from Large Language Models: A Concept Bottleneck Model for Hate and Counter Speech Recognition},
author = {Roberto Labadie-Tamayo and Djordje Slijepčević and Xihui Chen and Adrian Jaques Böck and Andreas Babic and Liz Freimann and Christiane Atzmüller Matthias Zeppelzauer},
journal= {arXiv preprint arXiv:2508.08274},
year = {2025}
}
备注
33 pages, 10 figures, This is a preprint of a manuscript accepted for publication in Information Processing & Management (Elsevier)