DocReward:用于结构化与风格化的文档奖励模型
计算机视觉与模式识别
2026-05-19 v3 人工智能
计算与语言
摘要
最近的 agentic workflow 自动化专业文档生成,但仅聚焦于文本质量,忽视了结构和风格专业性,这在可读性方面同样关键。这一差距主要源于缺乏有效的奖励模型,能够引导 agent 产生具备高结构和风格专业性的文档。我们引入 DocReward,一种基于文档结构和风格的文档奖励模型。为实现此目标,我们提出了一种文本质量中性化的 framework,以确保评估不受内容质量的影响,并构建 DocPair 数据集,包含 117K 对文档,覆盖 32 个领域和 267 种 document type。每对文档共享相同的 content,但在结构和风格专业性上存在差异。DocReward 采用布拉格-蒂尔 (Bradley-Terry) 损失进行训练。在手动标注的基准数据集上,DocReward 在相同设置下超过 GPT-5 超过 14.6 个百分点。强化学习实验进一步表明,DocReward 有效地引导 agent 产生在结构和风格专业性上持续更高的文档,凸显了其实际效用。
引用
@article{arxiv.2510.11391,
title = {DocReward: A Document Reward Model for Structuring and Stylizing},
author = {Junpeng Liu and Yuzhong Zhao and Bowen Cao and Jiayu Ding and Yilin Jia and Tengchao Lv and Yupan Huang and Wenshan Wu and Shaohan Huang and Nan Yang and Li Dong and Lei Cui and Tao Ge and Xun Wang and Huitian Jiao and Sun Mao and FNU Kartik and Si-Qing Chen and Wai Lam and Furu Wei},
journal= {arXiv preprint arXiv:2510.11391},
year = {2026}
}