中文

ClaHF:面向提升分类任务的人类反馈强化学习框架

机器学习 2026-05-19 v1

摘要

文本分类模型通常通过监督微调 (SFT) 进行训练。然而,SFT 实质上是从实例级标签进行行为克隆,无法充分捕捉样本间的相对偏好关系,这限制了模型在塑造决策边界和校准预测置信度方面的能力。本文提出 ClaHF,一种基于人类反馈的强化学习 (RL) 框架,用于文本分类,将偏好建模和 RL 优化集成到分类管道中,而无需额外的人类标注。与依赖仅限实例级监督的先前工作不同,ClaHF 构建多个候选预测及其相对排序关系,并在奖励模型 (RM) 中联合建模 Top-1 偏好以及非最优候选者之间的排序。这一设计将常规标签监督转换为可直接应用于策略优化的偏好信号。我们在覆盖三个场景类别的八个分类任务上进行了系统评估。结果表明,ClaHF 在 diverse language models (LMs) 上 consistent 提升了分类性能和置信度校准。数据和代码均已公开于 https://anonymous.4open.science/r/ClaHF。

关键词

引用

@article{arxiv.2605.17458,
  title  = {ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks},
  author = {Tianxiang Xu and Xiaoyan Zhu and Xin Lai and Jiayin Wang},
  journal= {arXiv preprint arXiv:2605.17458},
  year   = {2026}
}