中文

面向网络文本的高效分类模型

机器学习 2025-11-06 v1 信息论 math.IT

摘要

近年来,深度学习方法和实践的崛起带来了一个严重后果:计算资源和能源需求的持续增长导致碳足迹不断上升。文本分析领域也经历了这种单一化方法趋势的巨大转变。在本文中,原始的TF-IDF算法已被修改,提出了克莱门特术语频-逆文档频率(Clement Term Frequency-Inverse Document Frequency, CTF-IDF)用于数据预处理。本文主要讨论了使用CTF-IDF和更快的IRLBA算法进行降维的经典机器学习技术在文本分析中的有效性。本文所述的这两种技术的引入,确保了与深度学习方法相比,在碳足迹方面更高效、更快、更少计算密集,尽管在准确率上有所妥协。实验结果还显示,本文进一步讨论的经典机器学习方法在时间复杂性和模型准确率方面都实现了显著的减少和提高。

关键词

引用

@article{arxiv.2511.03107,
  title  = {An Efficient Classification Model for Cyber Text},
  author = {Md Sakhawat Hossen and Md. Zashid Iqbal Borshon and A. S. M. Badrudduza},
  journal= {arXiv preprint arXiv:2511.03107},
  year   = {2025}
}