重述、奖励、重复:基于叙事理论的强化学习故事生成
计算与语言
2026-01-27 v1 人工智能
摘要
尽管叙事性质主观,但过去的自动故事生成(ASG)工作仍依赖有限的真实来源进行训练和评估。本文探讨了使用强化学习(d-RLAIF)作为监督微调(SFT)的后训练替代方案。我们首先应用Todorov的叙事平衡理论(Theory of Narrative Equilibrium)来建立定义理想ASG质量的原则。我们让7B和14B的LLM-as-judge模型接受我们的原则,以测试其与人类标注员的对齐度,并在d-RLAIF期间提供奖励信号。我们使用Gemini-3-Flash来评估我们后训练模型的输出,并将其与来自TimeTravel数据集的人类编写的故事进行比较。我们表明,d-RLAIF是监督微调(SFT)的可行替代方案——生成的故事在多样性和与人类叙事惯例的对齐度方面更优。我们的论文展示了利用强化学习实现以语言为基础的后训练在诸如ASG等主观任务方面的潜力。
关键词
引用
@article{arxiv.2601.17226,
title = {Retell, Reward, Repeat: Reinforcement Learning for Narrative Theory-Informed Story Generation},
author = {David Y. Liu and Xanthe Muston and Aditya Joshi and Sebastian Sequoiah-Grayson},
journal= {arXiv preprint arXiv:2601.17226},
year = {2026}
}
备注
8 Pages, 6 figures