中文

利用两阶段半监督检测开放域对话中的攻击性内容

计算与语言 2018-12-03 v1

摘要

随着开放式人机聊天交互变得普遍,敏感内容检测愈发重要。本工作中,我们提出一种两阶段半监督方法,从公开网络资源中引导大规模数据以用于自动敏感语言检测。我们探索多种数据选择方法,包括 1) 使用黑名单按敏感度高低对在线讨论论坛排序,随后随机采样语句;以及 2) 训练一个弱监督模型并与黑名单结合,为在线讨论论坛中的句子打分以策划数据集。我们的数据收集策略灵活,使模型能够检测隐式敏感内容,而此类内容的人工标注可能较为困难。我们使用公开可用的标注数据集以及所提出的大规模半监督数据集训练模型。我们在 Twitter 与 Toxic Wikipedia 评论测试集,以及在一个大规模聊天机器人竞赛中收集的人工标注口语数据集上评估所有模型的性能。结果表明,在此收集数据上训练的模型在域内与域外测试集上均大幅优于基线模型,在域外测试集上取得 95.5% 的 F1 分数,而基于公共数据集训练的模型得分为 75%。我们还展示了大规模两阶段半监督能在多类敏感性(如仇恨言论、种族主义、性与色情内容等)上良好泛化,甚至无需为这些类别提供显式标签,在域外测试集上跨七类敏感内容取得平均召回率 95.5%,而使用标注公共数据集训练的模型平均召回率为 73.2%。

关键词

引用

@article{arxiv.1811.12900,
  title  = {Detecting Offensive Content in Open-domain Conversations using Two Stage Semi-supervision},
  author = {Chandra Khatri and Behnam Hedayatnia and Rahul Goel and Anushree Venkatesh and Raefer Gabriel and Arindam Mandal},
  journal= {arXiv preprint arXiv:1811.12900},
  year   = {2018}
}

备注

NIPS CONVAI Workshop 2018