利用特征密度提高自动网络欺凌检测的分类器训练效率
计算与语言
2021-11-04 v2 人工智能
计算机与社会
摘要
我们研究了使用不同语言学支持的特征预处理方法的特征密度(FD)的有效性,以估计数据集复杂性,进而用于在任何训练之前比较性地估计机器学习(ML)分类器的潜在性能。我们假设估计数据集复杂性可以减少所需实验迭代的次数。通过这种方式,我们可以优化资源密集型的机器学习模型训练,由于可用数据集规模的增加以及基于深度神经网络(DNN)的模型日益普及,这正成为一个严重问题。对更强大计算资源不断增长的需求也影响着环境,因为大规模机器学习模型的训练导致了令人担忧的二氧化碳排放量增长。该研究在多个数据集上进行,包括流行的数据集,如用于训练典型情感分析模型的 Yelp 商业评论数据集,以及试图解决网络欺凌问题的最新数据集。网络欺凌作为一个严重的社会问题,从语言表征的角度来看也是一个更为复杂的问题。我们使用了为多种语言(即英语、日语和波兰语)收集的网络欺凌数据集。数据集语言复杂性的差异使我们能够进一步讨论基于语言学的单词预处理的有效性。
引用
@article{arxiv.2111.01689,
title = {Improving Classifier Training Efficiency for Automatic Cyberbullying Detection with Feature Density},
author = {Juuso Eronen and Michal Ptaszynski and Fumito Masui and Aleksander Smywiński-Pohl and Gniewosz Leliwa and Michal Wroczynski},
journal= {arXiv preprint arXiv:2111.01689},
year = {2021}
}
备注
73 pages, 4 figures, 19 tables, Information Processing and Management, Vol. 58, Issue 5, September 2021, paper ID: 102616