用于自动在线审核的对话网络
信息检索
2019-02-01 v1 计算与语言
计算机与社会
社会与信息网络
摘要
在线社区中用户生成内容的审核是一项具有重大社会经济影响的挑战。然而,将此项工作委托给人工代理所产生的成本很高。因此,能够检测用户生成内容中滥用行为的自动系统备受关注。解决该问题有若干途径,但实践中最常见的是词过滤或正则表达式匹配。其主要局限在于易受用户有意混淆的影响,以及缺乏上下文敏感性。此外,它们依赖于语言,并可能需要适当的语料库用于训练。本文中,我们提出一种完全忽略消息内容的自动滥用检测系统。我们首先从原始聊天日志中提取对话网络,并通过拓扑度量对其表征。随后将这些作为特征,在我们的滥用检测任务上训练分类器。我们在一个源自法国大型多人在线游戏的用户评论数据集上彻底评估了我们的系统。我们确定了最合适的网络提取参数,并讨论了相对于拓扑与时间特性的特征的判别力。我们的方法在使用完整特征集时达到 83.89 的 F 值,优于现有方法。通过筛选最具判别力的特征,我们在保留大部分性能(82.65)的同时大幅削减了计算时间。
引用
@article{arxiv.1901.11281,
title = {Conversational Networks for Automatic Online Moderation},
author = {Etienne Papegnies and Vincent Labatut and Richard Dufour and Georges Linares},
journal= {arXiv preprint arXiv:1901.11281},
year = {2019}
}