中文

面向文本分类的成本感知模型选择:在精调编码器与大语言模型提示之间的多目标权衡

计算与语言 2026-02-09 v1

摘要

大型语言模型(LLM)如 GPT-4o 和 Claude Sonnet 4.5 在开放式推理和生成式语言任务中展现出强大的能力,导致其在广泛的 NLP 应用中广泛采用。然而,对于标签空间固定的结构化文本分类问题,模型选择往往仅以预测性能为驱动,忽略了生产系统中遇到的运营约束。本文present了对两种截然不同的文本分类范式进行系统性比较:零样本和少样本基于提示的大型语言模型,以及完全精调的编码器架构。我们在四个经典基准数据集(IMDB、SST-2、AG News 和 DBPedia)上评估这些方法,测量预测质量(宏平均F1分数)、推理延迟和费用。我们将模型评估建模为多目标决策问题,并使用帕累托前沿投影和反映不同部署情景的参数化效用函数进行权衡分析。我们的结果表明,来自 BERT 系列的精调编码器模型在分类性能上与之竞争,甚至往往更优越,而其成本和延迟低一个数量级到两个数量级。总体而言,我们的发现表明,对标准文本分类工作负载不加区分地使用大型语言模型可能导致系统级结果次优。相反,精调的编码器作为结构化 NLP 流水线的稳健且高效的组件,而大型语言模型则更适合作为混合架构中的补充元素。我们发布了所有代码、数据集和评估协议,以支持可重复性和成本感知的 NLP 系统设计。

关键词

引用

@article{arxiv.2602.06370,
  title  = {Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production},
  author = {Alberto Andres Valdes Gonzalez},
  journal= {arXiv preprint arXiv:2602.06370},
  year   = {2026}
}

备注

26 pages, 12 figures. Empirical benchmark comparing fine-tuned encoders and LLM prompting for text classification under cost and latency constraints