时不我待:语言变迁对自动评论审核的影响
计算与语言
2022-07-11 v1
摘要
网络仇恨的蔓延已成为托管评论版块的报纸所面临的一个显著问题。因此,人们日益关注使用机器学习和自然语言处理进行(半)自动滥用语言检测,以避免人工评论审核成本或不得不完全关闭评论版块。然而,以往许多关于滥用语言检测的研究都假设分类器运行在静态语言环境中,尽管语言和新闻处于持续变化之中。本文中,我们利用一个新的德文报纸评论数据集表明,使用朴素 ML 技术(如随机测试-训练划分)训练的分类器在未来数据上表现不佳,而时间分层评估划分更为合适。我们还表明,当在与训练数据不同的时段数据上评估时,分类器性能会迅速退化。我们的发现表明,在开发滥用语言检测系统时,有必要考虑语言的时间动态,否则将面临部署一个将迅速失效的模型的风险。
引用
@article{arxiv.2207.04003,
title = {No Time Like the Present: Effects of Language Change on Automated Comment Moderation},
author = {Lennart Justen and Kilian Müller and Marco Niemann and Jörg Becker},
journal= {arXiv preprint arXiv:2207.04003},
year = {2022}
}
备注
Published in proceedings of the 2022 IEEE 24th Conference on Business Informatics (CBI), Amsterdam, Netherlands. 17 pages, 4 figures