面向内容审核的自监督委婉语检测与识别
计算与语言
2021-04-01 v1
摘要
边缘群体和组织长期使用委婉语——即听起来普通却带有隐秘含义的词语——来掩饰其讨论内容。如今,委婉语的一个常见用途是规避社交媒体平台执行的内容审核策略。现有的自动执行策略的工具依赖于对“封禁列表”上词语的关键词搜索,但这些方法精度 notoriously 低下:即便仅限于脏话,仍会导致令人尴尬的误报。当一个常用普通词获得委婉含义时,将其加入基于关键词的封禁列表是行不通的:试想“pot”(储物容器还是大麻?)或“heater”(家用电器还是枪支?)。当前一代社交媒体公司转而雇佣人工核查帖子,但这成本高昂、有违人道且效果也好不了多少。人工审核员通常能明显察觉某词被委婉使用,却可能不知其隐秘含义,从而无法判断该消息是否违规。此外,当某个委婉语被封禁,使用该词的组织只需另造一个新词,使审核员总落后一步。本文展示了无监督算法,可通过在句子级语境中分析词语,同时检测被委婉使用的词并识别每个词的隐秘含义。与现有使用无上下文词嵌入的最先进技术相比,我们用于检测委婉语的算法在文本语料库中对未标注委婉语的检测准确率提高了30%至400%。据我们所知,我们用于揭示词语委婉含义的算法尚属首例。在内容审核者与策略规避者的军备竞赛中,我们的算法或有助于将天平向审核者倾斜。
引用
@article{arxiv.2103.16808,
title = {Self-Supervised Euphemism Detection and Identification for Content Moderation},
author = {Wanzheng Zhu and Hongyu Gong and Rohan Bansal and Zachary Weinberg and Nicolas Christin and Giulia Fanti and Suma Bhat},
journal= {arXiv preprint arXiv:2103.16808},
year = {2021}
}
备注
18 pages, 5 figures, 10 tables, 42nd IEEE Symposium on Security & Privacy (2021)