中文

面向鲁棒文档分类的自然语言处理模型

计算与语言 2026-02-25 v1

摘要

本文评估了用于自动文本分类的几种机器学习方法,同时设计了一个用于不平衡文档分类和分布的示范系统。该研究聚焦于在分类准确率和计算效率之间取得平衡,这是将AI集成到实际自动化管道中关键考虑因素。考察了三种复杂度不同的模型:朴素贝叶斯分类器、双向LSTM网络和微调的基于BERT的转换器模型。实验结果显示性能差异显著。BERT实现了最高准确率,始终超过99%,但需要显著更长的训练时间和更大的计算资源。BiLSTM模型提供了强大的折中方案,达到约98.56%的准确率,同时保持适中训练成本,提供稳健的上下文理解。朴素贝叶斯最快可训练,仅需毫秒级时间,却达到最低准确率,平均约为94.5%。类别不平衡影响所有方法,尤其在少数类别识别方面。实现了一个功能完善的示范系统以验证实际应用性,实现了技术请求的自动路由,处理吞吐量远超人工处理。该研究得出结论,BiLSTM在所述场景下提供最佳平衡方案,同时也概述了未来改进和进一步探索转换器架构的机遇。

关键词

引用

@article{arxiv.2602.20336,
  title  = {Natural Language Processing Models for Robust Document Categorization},
  author = {Radoslaw Roszczyk and Pawel Tecza and Maciej Stodolski and Krzysztof Siwek},
  journal= {arXiv preprint arXiv:2602.20336},
  year   = {2026}
}

备注

13 pages, 1 fiure, 5 tables