中文

通过全面 SFT 和 RL 研究推动 GenCLS++:大型语言模型中生成式分类的边界

计算与语言 2025-04-29 v1

摘要

作为机器学习中的基础任务,文本分类在许多领域发挥着关键作用。随着大型语言模型 (LLM) 的快速规模化,尤其是通过强化学习 (RL),对更具能力的判别器越来越有需求。因此,分类的进步对于增强 LLM 的总体能力至关重要。传统的判别方法将文本映射到标签,但忽视了 LLM 的内在生成优势。生成式分类通过让模型直接输出标签来实现这一点。然而,现有研究仍仅依赖简单 SFT,很少探究训练与推理提示之间的相互作用,也没有系统性地利用 RL 来构建生成式文本分类器,更没有将 SFT、RL 和推理时提示统一到一个框架中。我们通过 GenCLS++ 框架填补了这一差距,该框架在联合优化 SFT 和 RL 的同时,系统性地探索了五个高层策略维度——包括变体 in-context learning、类别定义、显式不确定性标签、语义无关的数值标签以及 perplexity-based 解码——在训练和推理期间。经过 SFT "策略预热"后,我们应用基于简单规则的奖励进行 RL,获得了显著的额外提升。在七个数据集上,GenCLS++ 相对于朴素 SFT 基线实现了平均 3.46% 的准确率提升;在公开数据集上,这一提升提升至 4.00%。值得注意的是,与推理密集型任务受益于显式思考过程不同,我们发现分类任务在没有此类思考步骤时表现更好。这些关于显式思考在分类任务中作用的见解,为未来 LLM 应用提供了有价值的指导。

关键词

引用

@article{arxiv.2504.19898,
  title  = {GenCLS++: Pushing the Boundaries of Generative Classification in LLMs Through Comprehensive SFT and RL Studies Across Diverse Datasets},
  author = {Mingqian He and Fei Zhao and Chonggang Lu and Ziyan Liu and Yue Wang and Haofu Qian},
  journal= {arXiv preprint arXiv:2504.19898},
  year   = {2025}
}