中文

检测可能损害公司声誉的敏感话题上的不当消息

计算与语言 2021-03-10 v1

摘要

就毒性而言,并非所有话题都同样“易燃”:关于乌龟或钓鱼的平静讨论较少引发不当有毒对话,而关于政治或性少数的讨论则更易如此。我们定义了一组可能引发不当与有毒消息的敏感话题,并描述了收集与标注适用性数据集的方法。尽管用户生成数据中的毒性已被充分研究,我们旨在定义一种更细粒度的不当性概念。不当性的核心在于其可能损害发言者的声誉。这与毒性有两点不同:(i) 不当性与话题相关;(ii) 不当消息并非有毒但仍不可接受。我们收集并发布了两个俄语数据集:一个话题标注数据集与一个适用性标注数据集。我们还发布了基于该数据训练的预训练分类模型。

关键词

引用

@article{arxiv.2103.05345,
  title  = {Detecting Inappropriate Messages on Sensitive Topics that Could Harm a Company's Reputation},
  author = {Nikolay Babakov and Varvara Logacheva and Olga Kozlova and Nikita Semenov and Alexander Panchenko},
  journal= {arXiv preprint arXiv:2103.05345},
  year   = {2021}
}

备注

Accepted to the Balto-Slavic NLP workshop 2021 co-located with EACL-2021