中文

如何利用已有数据进行少样本滥用内容检测

计算与语言 2024-05-07 v2

摘要

由于社交媒体平台种类繁多,滥用语言检测系统的需求多样且不断变化。已创建大量具有不同属性与标签集的标注语料库,如仇恨或厌女检测,但滥用言论的形式与目标持续演化。由于新语料标注成本高昂,本工作利用已有的、覆盖与滥用语言检测相关广泛任务的数据集。我们的目标是以仅用目标域少量训练样本,为新的目标标签集和/或语言廉价地构建模型。我们提出两步法:首先以多任务方式训练模型,随后对目标需求进行少样本适配。实验表明,使用已有数据集及目标任务仅少量样本,模型性能在单语与跨语言下均提升。分析还显示,我们的模型获得对滥用语言的通用理解,因其提升仅存于目标数据集的标签预测,并可受益于未直接用于目标任务的标签知识。

关键词

引用

@article{arxiv.2305.14081,
  title  = {How to Solve Few-Shot Abusive Content Detection Using the Data We Actually Have},
  author = {Viktor Hangya and Alexander Fraser},
  journal= {arXiv preprint arXiv:2305.14081},
  year   = {2024}
}

备注

Accepted at LREC-COLING 2024