如何利用已有数据进行少样本滥用内容检测
计算与语言
2024-05-07 v2
摘要
由于社交媒体平台种类繁多,滥用语言检测系统的需求多样且不断变化。已创建大量具有不同属性与标签集的标注语料库,如仇恨或厌女检测,但滥用言论的形式与目标持续演化。由于新语料标注成本高昂,本工作利用已有的、覆盖与滥用语言检测相关广泛任务的数据集。我们的目标是以仅用目标域少量训练样本,为新的目标标签集和/或语言廉价地构建模型。我们提出两步法:首先以多任务方式训练模型,随后对目标需求进行少样本适配。实验表明,使用已有数据集及目标任务仅少量样本,模型性能在单语与跨语言下均提升。分析还显示,我们的模型获得对滥用语言的通用理解,因其提升仅存于目标数据集的标签预测,并可受益于未直接用于目标任务的标签知识。
引用
@article{arxiv.2305.14081,
title = {How to Solve Few-Shot Abusive Content Detection Using the Data We Actually Have},
author = {Viktor Hangya and Alexander Fraser},
journal= {arXiv preprint arXiv:2305.14081},
year = {2024}
}
备注
Accepted at LREC-COLING 2024