用于有毒评论分类的卷积神经网络
计算与语言
2024-06-04 v1 机器学习
摘要
随着用户间在线交互通信产生的全球互联网使用,每日都有海量信息被生产出来。尽管这种情况显著提升了人类生活质量,但不幸的是它也伴随巨大危险,因为高毒性的在线文本可能引发人身攻击、网络骚扰与欺凌行为。过去几年这引发了工业界与学术界的关注,已有若干尝试去识别一种高效的在线有毒评论预测模型。然而这些步骤仍处起步阶段,亟需新方法与新框架。同时,持续出现的数据爆炸使得构建管理此类信息的新型机器学习计算工具成为迫切需求。幸而硬件、云计算与大数据管理的进步使得深度学习方法的发展展现出极具前景的性能。尤其对于文本分类,卷积神经网络(CNN)近期被提出以现代方式处理文本分析,强调文档中词的结构。本工作中,我们采用该方法在 Kaggle 当前关于维基百科讨论页编辑的竞赛所提供的大量文档中发现有毒评论。为佐证此选择,我们选取 CNN 与传统词袋文本分析方法进行比较,后者结合了一组被证明显著有效的文本分类算法。所报告结果提供了充分证据,表明 CNN 提升了有毒评论分类性能,强化了该方向的研究兴趣。
引用
@article{arxiv.1802.09957,
title = {Convolutional Neural Networks for Toxic Comment Classification},
author = {Spiros V. Georgakopoulos and Sotiris K. Tasoulis and Aristidis G. Vrahatis and Vassilis P. Plagianakos},
journal= {arXiv preprint arXiv:1802.09957},
year = {2024}
}