基于掩码语言模型的委婉短语检测
计算与语言
2021-09-13 v1
摘要
边缘群体和组织使用委婉语——听起来普通且看似无害但带有隐秘含义的词语——来掩盖他们正在讨论的内容,这是一种众所周知的方法。例如,毒品交易者通常用“pot”指代大麻,用“avocado”指代海洛因。从社交媒体内容审核的角度来看,尽管 NLP 的最新进展已经能够自动检测此类单词委婉语,但目前尚无现有工作能够自动检测多词委婉语,例如“blue dream”(大麻)和“black tar”(海洛因)。据我们所知,我们的论文首次解决了无需人工的委婉短语检测问题。我们首先在原始文本语料库(例如,社交媒体帖子)上进行短语挖掘,以提取高质量短语。然后,我们利用词嵌入相似度来选择一组委婉短语候选。最后,我们使用掩码语言模型——SpanBERT 对这些候选进行排序。与强基线相比,我们报告称使用我们的算法检测委婉短语的准确率提高了 20-50%。
引用
@article{arxiv.2109.04666,
title = {Euphemistic Phrase Detection by Masked Language Model},
author = {Wanzheng Zhu and Suma Bhat},
journal= {arXiv preprint arXiv:2109.04666},
year = {2021}
}