中文

自然语言处理中脏话混淆的现状

计算与语言 2022-10-17 v1

摘要

关于仇恨言论的研究使得科学出版物中考虑粗鲁和有害示例变得不可避免。这引发了各种问题,例如是否应混淆脏话。虽然科学必须准确披露其工作,但仇恨言论的不当传播对读者有害,并增加其在互联网上的频率。在保持出版物专业外观的同时,混淆脏话使得评估内容变得困难,尤其对于非母语者。调查 150 篇 ACL 论文后,我们发现混淆通常用于英语而非其他语言,即便如此也相当不均衡。我们讨论了混淆的问题,并建议了一个称为 PrOf 的多语言社区资源,其带有用于标准化脏话混淆过程的 Python 模块。我们相信 PrOf 可帮助科学出版物政策使仇恨言论工作可获取且可比较,无论语言为何。

关键词

引用

@article{arxiv.2210.07595,
  title  = {The State of Profanity Obfuscation in Natural Language Processing},
  author = {Debora Nozza and Dirk Hovy},
  journal= {arXiv preprint arXiv:2210.07595},
  year   = {2022}
}