中文

基于黑箱大语言模型的层次化文本分类

计算与语言 2025-08-07 v1 机器学习

摘要

层次化文本分类(HTC)旨在将文本分配到结构化标签层次结构中,但由于数据稀缺和模型复杂性,面临挑战。本研究探讨了使用通过 API 访问的黑箱大语言模型(LLM)进行 HTC 的可行性,作为需要大量标记数据和计算资源的传统机器学习方法的替代方案。我们评估了三种提示策略——直接叶标签预测(DL)、直接层次化标签预测(DH)和自上而下的多步骤层次化标签预测(TMH)在 zero-shot 和 few-shot 设置下的准确性和成本效益。两个数据集上的实验表明,few-shot 设置在准确率上持续优于 zero-shot 设置。虽然传统机器学习模型在浅层层次结构的数据集上实现高准确率,但 LLM(尤其是 DH 策略)在深层层次结构的数据集上往往优于机器学习模型。由于 DH 策略需要更深的标签层次结构而产生更高的输入标记,API 成本显著增加。这些结果强调了准确率提升与计算成本之间的权衡。这些发现凸显了黑箱 LLM 在 HTC 中的潜力,同时也强调了在平衡性能和成本方面 carefully 选择提示策略的必要性。

关键词

引用

@article{arxiv.2508.04219,
  title  = {Hierarchical Text Classification Using Black Box Large Language Models},
  author = {Kosuke Yoshimura and Hisashi Kashima},
  journal= {arXiv preprint arXiv:2508.04219},
  year   = {2025}
}

备注

16 pages, 6 figures