从AI粗糙到AI精炼:通过编辑驱动的写作奖励与测试时计算对齐语言模型
计算与语言
2025-08-14 v3 人工智能
机器学习
摘要
AI生成文本正跨越创意写作、新闻、营销内容和科学文章等多个领域。模型可以遵循用户提供的指令生成连贯且语法正确的输出,但本文研究更根本的问题:如何评估和改进AI生成文本的写作质量?写作质量评估在社区中受到了较少关注,部分原因在于其根本上是主观的,需要专业知识。我们首先通过整合五个写作偏好数据集,构建Writing Quality Benchmark(WQ),形成4,729条写作质量判断。我们的实验表明,大多数竞争基线,包括在推理任务中表现突出的前沿LLM,几乎不跑赢随机基线。随后,我们训练了不同规模的专用写作质量奖励模型(WQRM),用于写作质量评估,模型在四个分布外测试集上表现出强大的泛化能力,并在WQ基准上达到74%的准确率。为进一步展示WQRM在推理阶段的实际效益,我们利用额外的测试时计算生成并排序多个候选修订,从而选择初始草稿中质量更高的输出。人类评估通过9名经验丰富的写作者确认,WQRM-based selection产生的写作样本总体上被专家偏好66%,当奖励差距超过1分时达到72.2%。我们发布数据集和模型,以鼓励社区参与写作质量评估,发展更符合人类偏好的AI写作系统。
引用
@article{arxiv.2504.07532,
title = {AI-Slop to AI-Polish? Aligning Language Models through Edit-Based Writing Rewards and Test-time Computation},
author = {Tuhin Chakrabarty and Philippe Laban and Chien-Sheng Wu},
journal= {arXiv preprint arXiv:2504.07532},
year = {2025}
}
备注
Under Submission