可解释的滥用检测:作为意图分类与槽填充
计算与语言
2022-10-07 v1
摘要
为了主动为社交媒体用户提供安全的在线体验,需要能够检测有害帖子并迅速提醒平台审核员的系统。为了保证执行一致的政策,审核员被提供了详细指南。相比之下,大多数最先进(SOTA)的模型从标注示例中学习什么是滥用,并因此基于虚假线索(例如群体标识符的存在)做出预测,这可能不可靠。在这项工作中,我们引入了策略感知滥用检测(policy-aware abuse detection)的概念,放弃了系统能够仅通过检查数据可靠地学习哪些现象构成滥用的不现实期望。我们提出了一种对审核员希望执行的政策进行机器友好表示的方法,将其分解为一组意图与槽。我们收集并标注了一个包含3,535条英文帖子及其槽的数据集,并展示了意图分类与槽填充的架构如何可用于滥用检测,同时为模型决策提供理由。
引用
@article{arxiv.2210.02659,
title = {Explainable Abuse Detection as Intent Classification and Slot Filling},
author = {Agostina Calabrese and Björn Ross and Mirella Lapata},
journal= {arXiv preprint arXiv:2210.02659},
year = {2022}
}
备注
14 pages, 2 figures, to be published in TACL (pre-MIT Press publication version)