StoryAlign: 面向故事生成的奖励模型评估与训练
计算与语言
2026-05-07 v1 人工智能
摘要
故事生成旨在自动产生连贯、结构化且引人入胜的叙事。尽管大语言模型(LLM)显著推动了文本生成的发展,但 LLM 生成的故事在复杂叙事结构和人类对齐偏好方面仍与人类创作的作品存在差异。一个关键原因在于缺乏对人类故事偏好的有效建模,这些偏好本质上是主观的且尚未被充分探索。在本工作中,我们系统地评估了人类故事偏好的建模,并引入了 StoryRMB,这是首个用于评估故事偏好奖励模型的基准。StoryRMB 包含 个高质量、经人工验证的实例,每个实例由一个提示、一个被选中的故事和三个被拒绝的故事组成。我们发现现有的奖励模型难以选择人类偏好的故事,最佳模型仅达到 的准确率。为解决这一局限性,我们跨多个领域构建了约 个高质量的故事偏好对,并开发了 StoryReward,这是一个在该数据集上训练的用于故事偏好的先进奖励模型。StoryReward 在 StoryRMB 上实现了最先进(SoTA)的性能,优于大得多的模型。我们还在下游的测试时缩放应用中采用 StoryReward 进行最佳 N 选(BoN)故事选择,发现它通常能选择出更符合人类偏好的故事。我们将发布我们的数据集、模型和代码以促进未来的研究。相关代码和数据可在 https://github.com/THU-KEG/StoryReward 获取。
引用
@article{arxiv.2605.04831,
title = {StoryAlign: Evaluating and Training Reward Models for Story Generation},
author = {Haotian Xia and Hao Peng and Yunjia Qi and Xiaozhi Wang and Bin Xu and Lei Hou and Juanzi Li},
journal= {arXiv preprint arXiv:2605.04831},
year = {2026}
}