中文

研究者通过逐个文本分类浪费了 80% 的大语言模型标注成本

计算与语言 2026-04-07 v1

摘要

大型语言模型 (LLM) 正在跨越社会科学领域,用于文本分类,但研究者几乎都只对每个变量逐个文本进行分类。对 10 万篇文本进行四个变量的编码需要 40 万次 API 调用。将批量处理 25 项并将所有变量堆叠到单个提示中,可将调用次数减少至 4000 次,显著降低超过 80% 的 token 成本。是否会降低编码质量尚不清楚。我们在 3962 篇专家编码推文上,对 8 个来自 4 个供应商的生产 LLM 进行测试,测试中变更批量大小从 1 到 1000 项,并将每个提示中堆叠最多 25 个编码维度。六个模型在批量大小达到 100 时,准确率仍保持在单项基准水平的 ±2% 内。对于最多 10 个维度的变量堆叠,结果与单变量编码相当,性能下降是由任务复杂性而非提示长度所致。在此安全操作范围内,批量和堆叠造成的测量误差小于地面_truth 数据中典型的编码者间不一致水平。

关键词

引用

@article{arxiv.2604.03684,
  title  = {Researchers waste 80% of LLM annotation costs by classifying one text at a time},
  author = {Christian Pipal and Eva-Maria Vogel and Morgan Wack and Frank Esser},
  journal= {arXiv preprint arXiv:2604.03684},
  year   = {2026}
}