基于理由引导的小样本分类用于辱骂性语言检测
计算与语言
2023-07-31 v2 计算机与社会
摘要
辱骂性语言是在线社交媒体中一个令人担忧的问题。以往关于辱骂性语言检测的研究涵盖了不同平台、语言、人群等。然而,使用这些数据集训练的模型在跨域评估设置中表现不佳。为克服此问题,一种常见策略是利用来自目标域的少量样本训练模型,以在该域中获得更好性能(跨域小样本训练)。但这可能导致模型过拟合这些样本的人为痕迹。一个引人注目的解决方案是引导模型关注理由(rationales),即证明文本标签正当性的文本片段。该方法已被发现能在多种 NLP 任务中提升模型在域内设置下的性能。本文中,我们提出 RGFS(Rationale-Guided Few-Shot Classification,理由引导小样本分类)用于辱骂性语言检测。我们首先构建一个多任务学习设置,联合学习理由、目标和标签,发现相比仅训练理由分类器,理由检测任务的宏 F1 提升了 6%。我们引入两种理由集成的基于 BERT 的架构(RGFS 模型),并在五个不同的辱骂性语言数据集上评估我们的系统,发现在小样本分类设置下,基于 RGFS 的模型在宏 F1 分数上比基线模型高出约 7%,并与在其他源域上微调的模型表现相当。此外,基于 RGFS 的模型在可解释性(plausibility)方面优于基于 LIME/SHAP 的方法,在忠实性(faithfulness)方面性能接近。
引用
@article{arxiv.2211.17046,
title = {Rationale-Guided Few-Shot Classification to Detect Abusive Language},
author = {Punyajoy Saha and Divyanshu Sheth and Kushal Kedia and Binny Mathew and Animesh Mukherjee},
journal= {arXiv preprint arXiv:2211.17046},
year = {2023}
}
备注
11 pages, 14 tables, 3 figures, The code repository is https://github.com/punyajoy/RGFS_ECAI