通过 GRPO 精调捕捉长篇故事生成中经典作者风格
计算与语言
2026-04-22 v3
摘要
在长篇故事生成中评估和优化作者风格 remains 挑战性,因为风格往往依赖于 ad hoc prompting 进行评估,且常与整体写作质量混合。我们提出了两个阶段的管道。首先,我们通过作者身份验证监督微调一个专用的风格相似性评判器,并将其相似性输出校准为有界 [0,1] 的奖励。其次,我们将该评判器作为 GRPO (Group Relative Policy Optimization) 中的主要奖励,用于为 8B 故事生成器进行风格条件写入,避免使用 Direct Preference Optimization (DPO) 所需的接受/拒绝监督。在四位目标作者 (马克·吐温、Jane Austen、查尔斯·狄古、托马斯·哈里德) 处,GRPO 训练的 8B 模型在风格得分上优于开源基线,平均风格得分为 0.893。这些结果表明,AV-校准奖励建模为在中等模型规模和训练预算下实现长篇生成可控风格迁移提供了实用机制。
引用
@article{arxiv.2512.05747,
title = {Capturing Classic Authorial Style in Long-Form Story Generation with GRPO Fine-Tuning},
author = {Jinlong Liu and Mohammed Bahja and Venelin Kovatchev and Mark Lee},
journal= {arXiv preprint arXiv:2512.05747},
year = {2026}
}
备注
Accepted to CoNLL 2026