中文

性、毒品与暴力

计算与语言 2016-08-12 v1

摘要

自动检测不当内容可能是一项困难的 NLP 任务,它不仅需要识别特定关键词,还需要理解语境和暗示。由于在线用户生成内容的数量巨大,自动检测变得日益必要。我们采用了一种 largely unsupervised 的方法,利用来自社区自助出版网站的大量叙事语料库和一小部分众包标注数据。我们探索了使用隐狄利克雷分配 (latent Dirichlet allocation) 及其变体进行主题建模,并利用这些模型回归适当性评分,从而有效地自动化适宜性评级。结果表明,推断出的某些主题可能有助于检测潜在的不当内容——其召回率高达 96%,且回归误差较低。

关键词

引用

@article{arxiv.1608.03448,
  title  = {Sex, drugs, and violence},
  author = {Stefania Raimondo and Frank Rudzicz},
  journal= {arXiv preprint arXiv:1608.03448},
  year   = {2016}
}