中文

TRACT:回归感知微调结合链路思考推理用于 LLM 评判

计算与语言 2025-06-09 v2

摘要

LLM 评判范式使用大型语言模型(LLM)进行自动文本评估,通过评分准则为输入文本分配数值评估。现有 LLM 评判方法使用交叉熵(CE)损失进行微调,忽略了评分预测的数值性质。最近的工作通过回归感知微调来解决 LLM 微调的数值预测限制,但未考虑评分预测的链路思考(CoT)推理。在本文中,我们引入了 TRACT(Two-stage Regression-Aware fine-tuning with CoT),一种结合 CoT 推理与回归感知训练的方法。TRACT 包含两个阶段:首先,对种子 LLM 进行微调以生成 CoT,这些 CoT 作为第二个阶段微调的监督信号。TRACT 的训练目标结合了用于学习 CoT 推理能力的 CE 损失和用于评分预测的回归感知损失。实验在四个 LLM 评判数据集和两个 LLM 上表明,TRACT 显著优于现有方法。广泛的消融研究验证了 TRACT 中每个组件的重要性。

关键词

引用

@article{arxiv.2503.04381,
  title  = {TRACT: Regression-Aware Fine-tuning Meets Chain-of-Thought Reasoning for LLM-as-a-Judge},
  author = {Cheng-Han Chiang and Hung-yi Lee and Michal Lukasik},
  journal= {arXiv preprint arXiv:2503.04381},
  year   = {2025}
}

备注

ACL 2025 camera-ready Codes and models are available at https://github.com/d223302/TRACT