探索特征密度在估计机器学习分类器性能中的潜力及其在网络欺凌检测中的应用
计算与语言
2022-06-07 v1 人工智能
机器学习
摘要
在本研究中,我们分析特征密度(FD)作为一种在训练前比较性地估计机器学习(ML)分类器性能的方法的潜力。本研究的目标是解决 ML 模型资源密集型训练的问题,由于数据集规模持续增长以及深度神经网络(DNN)日益流行,该问题正变得十分严峻。对更强大计算资源的需求不断上升,也对环境造成影响,因为大规模 ML 模型的训练正导致 CO2 排放量以惊人的速度增长。我们的方法旨在优化自然语言处理中 ML 模型的资源密集型训练,以减少所需的实验迭代次数。我们在以往利用 FD 提升分类器训练效率的尝试基础上进行了拓展,同时也深入考察了多种基于语言学的特征预处理方法在对话分类(特别是网络欺凌检测)中的有效性。
引用
@article{arxiv.2206.01949,
title = {Exploring the Potential of Feature Density in Estimating Machine Learning Classifier Performance with Application to Cyberbullying Detection},
author = {Juuso Eronen and Michal Ptaszynski and Fumito Masui and Gniewosz Leliwa and Michal Wroczynski},
journal= {arXiv preprint arXiv:2206.01949},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2111.01689