中文

加强虚假信息传播检测:利用 SVM 与复杂文本向量化技术并与 BERT 进行比较

计算与语言 2026-02-02 v4

摘要

错误信息的快速传播,特别是通过在线平台的传播,凸显了对可靠检测系统的迫切需求。本研究探讨了机器学习和自然语言处理的利用,具体而言是支持向量机(SVM)和 BERT,以检测假新闻。我们对 SVM 采用了三种不同的文本向量化方法:词频-逆文档频率(TF-IDF)、Word2Vec 和词袋模型,评估它们在区分真实新闻和假新闻方面的有效性。此外,我们将这些方法与 transformer 大型语言模型 BERT 进行了比较。我们的综合方法包括详细的预处理步骤、严格的模型实现和全面的评估,以确定最有效的技术。结果表明,虽然 BERT 以 99.98% 的准确率和 0.9998 的 F1 分数实现了卓越的性能,但具有线性核和 BoW 向量化的 SVM 模型也表现异常出色,达到了 99.81% 的准确率和 0.9980 的 F1 分数。这些发现强调,尽管 BERT 性能优越,但结合 BoW 和 TF-IDF 向量化方法的 SVM 模型表现极为接近,在计算需求较低的优势下提供了极具竞争力的性能。

关键词

引用

@article{arxiv.2411.12703,
  title  = {Strengthening False Information Propagation Detection: Leveraging SVM and Sophisticated Text Vectorization Techniques in comparison to BERT},
  author = {Ahmed Akib Jawad Karim and Kazi Hafiz Md Asad and Aznur Azam},
  journal= {arXiv preprint arXiv:2411.12703},
  year   = {2026}
}

备注

6 pages, 6 figures. This paper has been published in IEEE conference proceedings (QPAIN 2025