博客数据对比:机器学习 vs 神经符号模型用于性别分类
机器学习
2026-01-29 v2
摘要
文本分类问题,如从博客中进行性别分类,一直是机器学习算法广泛研究的成熟领域,具有市场分析、客户推荐和推荐系统等多个应用领域。本研究presents了对广泛使用的机器学习算法的比较分析,包括支持向量机 (SVM)、朴素贝叶斯 (NB)、逻辑回归 (LR)、AdaBoost、XGBoost 以及一种 SVM 变体 (SVM_R),与神经符号人工智能 (NeSy) 进行比较。该论文还探讨了文本表示方式的影响,如 TF-IDF、Universal Sentence Encoder (USE) 和 RoBERTa。此外,还探讨了各种特征提取技术,包括 Chi-Square、互信息和主成分分析。基于这些,我们引入了机器学习和深度学习方法与 NeSy 方法的比较分析。实验结果表明,尽管数据集有限,使用 NeSy 方法的性能与强大的 MLP 结果相当。未来的工作将扩展知识库、扩大嵌入类型的范围,并进一步研究 NeSy 方法的有效性。
引用
@article{arxiv.2512.16687,
title = {Blog Data Showdown: Machine Learning vs Neuro-Symbolic Models for Gender Classification},
author = {Natnael Tilahun Sinshaw and Mengmei He and Tadesse K. Bahiru and Sudhir Kumar Mohapatra},
journal= {arXiv preprint arXiv:2512.16687},
year = {2026}
}
备注
There is an error present within the paper concerning its results