中文

开放权重大语言模型在政治科学文本分类中常常与商业API竞争

应用统计 2026-05-20 v1

摘要

研究人员能否使用本地开放权重模型来代替商业API进行LLM文本分类?本地模型可避免边际API费用、将数据保留在研究者的机器上,并且更容易保存确切的模型版本。我对比评估了五个本地模型与四个商业API模型,在34个政治科学分类任务中进行测试。本地模型在较简单的任务上往往具有竞争力。在任务特定的oracle比较中,本地模型在9个任务上匹配或超过API性能;平均情况下,最佳API模型与最佳本地模型之间的F1分数差为0.015。四个最强观察到的模型平均水平在0.021的F1分数内。API模型在复杂任务上表现最为突出,这些任务具有大量标签或每个项目多个输出。将多个项目批量处理到一个提示中通常会减少每个项目的本地运行时间,但具体的模型-任务组合可能会返回无效的响应格式或标签。综合来看,结果表明,对于许多政治科学分类任务,本地开放权重模型是实际可行的备选方案,前提是研究人员在任务特定标签上验证候选模型,并在规模化之前检查批量处理的可靠性。

关键词

引用

@article{arxiv.2605.19275,
  title  = {Open-Weight LLMs Are Often Competitive with Commercial APIs for Political Science Text Classification},
  author = {Hanno Hilbig},
  journal= {arXiv preprint arXiv:2605.19275},
  year   = {2026}
}