通过模型蒸馏实现高效且可解释的仇恨言论检测
计算与语言
2025-05-06 v1
摘要
自动检测仇恨和辱骂性语言对于打击其在网络上的传播至关重要。此外,识别并解释仇恨言论有助于教育人们认识其负面影响。然而,目前大多数检测模型作为黑盒运行,缺乏可解释性和说明性。在此背景下,大型语言模型(LLM)已被证明对仇恨言论检测有效,并能促进可解释性。尽管如此,它们的运行计算成本高昂。在这项工作中,我们提出利用思维链从大型语言模型中蒸馏出支持仇恨言论分类任务的解释。为这些任务配备小型语言模型将有助于其在实际运营环境中的使用。在本文中,我们证明了蒸馏模型提供的解释与大型模型质量相同,同时在分类性能上超越了它们。这种分类和解释的双重能力推进了仇恨言论检测,使其更经济、更易懂且更具可操作性。
引用
@article{arxiv.2412.13698,
title = {Towards Efficient and Explainable Hate Speech Detection via Model Distillation},
author = {Paloma Piot and Javier Parapar},
journal= {arXiv preprint arXiv:2412.13698},
year = {2025}
}