自动文本分类的全面基准测试:从传统方法到大语言模型
计算与语言
2025-04-03 v1 人工智能
摘要
自动文本分类(ATC)在过去十年中经历了显著的进展,最佳例证之一是最近的小型和大型语言模型(SLMs 和 LLMs),它们由 Transformer 架构所支持。尽管近期的方法在有效性方面取得了改进,但关于这些近期方法的有效性提升是否补偿了其显著更高成本的全面成本效益分析仍缺失于文献中。具体而言,本工作的主要贡献有两个:(i) 我们提供了对十二种传统和近期 ATC 解决方案(包括五个开源 LLM)成本效益的科学严谨比较分析;(ii) 一个大型基准测试集合,包含 {22 个数据集},包括情感分析和主题分类,采用折叠交叉验证程序划分的训练-验证-测试集,并附带文档和代码。代码、数据和文档的发布使社区能够复制实验,以更科学的方式推动该领域的发展。我们的实验结果表明,LLM 在有效性方面优于传统方法(平均提升最高达 26%-7.1%),也优于 SLMs(平均提升最高达 4.9%-1.9%)。然而,LLM 由于微调导致计算成本显著更高,平均比传统方法慢 590 倍,比 SLMs 慢 8.5 倍。结果表明,以下建议:(1) 对于需要最佳有效性且能承担成本的应用,采用 LLM;(2) 对于资源受限的应用或无法负担大型 LLM 微调成本的场景,采用 Logistic Regression 和 SVM 等传统方法;(3) 对于近似最佳的有效性-效率权衡,采用 Roberta 等 SLM。
引用
@article{arxiv.2504.01930,
title = {A thorough benchmark of automatic text classification: From traditional approaches to large language models},
author = {Washington Cunha and Leonardo Rocha and Marcos André Gonçalves},
journal= {arXiv preprint arXiv:2504.01930},
year = {2025}
}
备注
7 pages, 2 figures, 3 tables