特征密度与语言学支撑嵌入应用于改进基于机器学习的网络欺凌检测的初步研究
计算与语言
2022-06-07 v1 人工智能
机器学习
摘要
在本研究中,我们考察了当使用数据集的多种语言学预处理方法时机器学习(ML)分类器性能的变化,特别关注卷积神经网络(CNN)中语言学支撑的嵌入。此外,我们研究了特征密度(Feature Density)的概念,并确认其 comparatively 预测 ML 分类器(包括 CNN)性能的潜力。研究在 Kaggle 自动网络欺凌检测竞赛提供的 Formspring 数据集上进行。该数据集由客观专家(心理学家)重新标注,因为专业标注在网络欺凌研究中的重要性已被多次指出。研究证实了神经网络在网络欺凌检测中的有效性以及分类器性能与特征密度之间的相关性,同时提出了一种为卷积神经网络训练多种语言学支撑嵌入的新方法。
引用
@article{arxiv.2206.01889,
title = {Initial Study into Application of Feature Density and Linguistically-backed Embedding to Improve Machine Learning-based Cyberbullying Detection},
author = {Juuso Eronen and Michal Ptaszynski and Fumito Masui and Gniewosz Leliwa and Michal Wroczynski and Mateusz Piech and Aleksander Smywinski-Pohl},
journal= {arXiv preprint arXiv:2206.01889},
year = {2022}
}