中文

BTZSC:跨编码器、嵌入模型、重排器与大语言模型的零样本文本分类基准

计算与语言 2026-03-13 v1 人工智能 机器学习 机器学习

摘要

零样本文本分类(ZSC)通过将文本直接匹配到人类可读标签描述,提供了消除昂贵任务特定标注的前景。虽然早期方法主要依赖针对自然语言推理(NLI)微调的cross-encoder模型,但近期出现的文本嵌入模型、重排器以及指令调优大语言模型(LLM)已挑战了NLI架构的主导地位。然而,系统比较这些多样化方法仍然困难。现有评估如MTEB,常通过监督探针或微调纳入标记示例,使真正的零样本能力得不到充分探索。为此,我们引入BTZSC——一个涵盖22个公开数据集的综合基准,涉及情感、主题、意图和情感分类,覆盖多样化的领域、类别基数和文档长度。利用BTZSC,我们在四大模型家族之间进行系统比较:NLI cross-encoder、嵌入模型、重排器和指令调优LLM,涵盖38个公开和自定义检查点。我们的结果显示:(i)现代重排器以Qwen3-Reranker-8B为代表,达到了新的状态最佳成绩,macro F1=0.72;(ii)如GTE-large-en-v1.5等强劲嵌入模型显著缩小了准确率差距,同时在准确率与延迟之间提供了最佳权衡;(iii)4--12B参数的指令调优LLM取得具竞争力的表现(macro F1最高达0.67),在主题分类方面尤为出色,但仍落后于专门化的重排器;(iv)NLI cross-encoder即使随着背bone规模增大也趋于平台期;(v)规模化主要受益于重排器和LLM,而非嵌入模型。BTZSC及其评估代码已公开发布,以支持公平且可复现的零样本文本理解进展。

关键词

引用

@article{arxiv.2603.11991,
  title  = {BTZSC: A Benchmark for Zero-Shot Text Classification Across Cross-Encoders, Embedding Models, Rerankers and LLMs},
  author = {Ilias Aarab},
  journal= {arXiv preprint arXiv:2603.11991},
  year   = {2026}
}

备注

Accepted at ICLR 2026. 31 pages, 5 figures, 9 tables. Code: https://github.com/IliasAarab/btzsc ; Dataset: https://huggingface.co/datasets/btzsc/btzsc ; Leaderboard: https://huggingface.co/spaces/btzsc/btzsc-leaderboard . Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), 2026