基于文本片段的细粒度人类反馈进行语言模型微调
计算与语言
2025-12-30 v1
摘要
我们提出一种方法和数据集,用于基于反馈驱动的改进链对语言模型进行偏好监督微调。给定模型响应后,注释员通过标记"喜欢"和"不喜欢"的片段并指定他们喜欢或不喜欢的原因来提供细粒度反馈。基础模型随后依据左到右的顺序重写不喜欢的片段,形成一系列渐进性的改进。我们从链中每个相邻步骤构造偏好对,用于直接对齐,使模型能够从局部、有针对性的编辑中学习。我们发现,我们的方法在基于标准A/B偏好排序或完整对抗重写的直接对齐方法方面表现更好,表明结构化、修订式的监督导致更高效和更有效的偏好调优。
引用
@article{arxiv.2512.23693,
title = {Fine-Tuning LLMs with Fine-Grained Human Feedback on Text Spans},
author = {Sky CH-Wang and Justin Svegliato and Helen Appel and Jason Eisner},
journal= {arXiv preprint arXiv:2512.23693},
year = {2025}
}