中文

博客数据对比:机器学习 vs 神经符号模型用于性别分类

机器学习 2026-01-29 v2

摘要

文本分类问题,如从博客中进行性别分类,一直是机器学习算法广泛研究的成熟领域,具有市场分析、客户推荐和推荐系统等多个应用领域。本研究presents了对广泛使用的机器学习算法的比较分析,包括支持向量机 (SVM)、朴素贝叶斯 (NB)、逻辑回归 (LR)、AdaBoost、XGBoost 以及一种 SVM 变体 (SVM_R),与神经符号人工智能 (NeSy) 进行比较。该论文还探讨了文本表示方式的影响,如 TF-IDF、Universal Sentence Encoder (USE) 和 RoBERTa。此外,还探讨了各种特征提取技术,包括 Chi-Square、互信息和主成分分析。基于这些,我们引入了机器学习和深度学习方法与 NeSy 方法的比较分析。实验结果表明,尽管数据集有限,使用 NeSy 方法的性能与强大的 MLP 结果相当。未来的工作将扩展知识库、扩大嵌入类型的范围,并进一步研究 NeSy 方法的有效性。

关键词

引用

@article{arxiv.2512.16687,
  title  = {Blog Data Showdown: Machine Learning vs Neuro-Symbolic Models for Gender Classification},
  author = {Natnael Tilahun Sinshaw and Mengmei He and Tadesse K. Bahiru and Sudhir Kumar Mohapatra},
  journal= {arXiv preprint arXiv:2512.16687},
  year   = {2026}
}

备注

There is an error present within the paper concerning its results