从粗到细:面向写作导向生成任务的基准测试与奖励建模
计算与语言
2026-05-01 v1
摘要
大型语言模型在文本生成方面取得了显著进展,但在生成写作任务方面仍存在挑战。在评估方面,现有基准测试粗略地评估写作奖励模型,无法从特定要求的角度衡量性能。在训练方面,现有的训练方法要么使用 LLM 作为评判器,要么训练粗粒度奖励模型,缺乏针对细化要求的奖励建模。为此,我们提出了用于写作奖励模型的细粒度评估管道 WEval,以及细粒度强化学习训练框架 WRL。WEval 的评估数据覆盖多个任务类别和要求类型,能够通过衡量奖励模型排序与黄金排序之间的相关性,对写作奖励模型进行系统化评估。WRL 通过有选择地删除指令要求来构建正负样本,从而实现更精确的奖励模型训练。实验表明,我们的模型在各种写作基准测试中均实现了显著的改进,并展现出强大的泛化能力。该代码和数据已公开于 \href{https://github.com/Rainier-rq1/From_Coarse_to_Fine}{https://github.com/Rainier-rq1/From\_Coarse\_to\_Fine}。
引用
@article{arxiv.2604.27453,
title = {From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks},
author = {Qingyu Ren and Tianjun Pan and Xingzhou Chen and Xuhong Wang},
journal= {arXiv preprint arXiv:2604.27453},
year = {2026}
}