DPWriter:面向创意写作的多样化规划分支强化学习
计算与语言
2026-01-15 v1 人工智能
摘要
基于强化学习(RL)的大语言模型(LLM)增强通常会导致输出多样性降低,从而削弱其在创意写作等开放式任务中的效用。当前方法缺乏引导多样化探索的显式机制,而是优先考虑优化效率和性能,而非多样性。本文提出了一个围绕半结构化长思维链(CoT)构建的强化学习框架,其中生成过程被分解为明确规划的中间步骤。我们引入了一种多样化规划分支方法,该方法根据多样性变化在规划阶段策略性地引入分歧,同时引入一个群体感知多样性奖励以鼓励独特的轨迹。在创意写作基准上的实验结果表明,我们的方法在不牺牲生成质量的前提下显著提高了输出多样性,持续优于现有基线。
引用
@article{arxiv.2601.09609,
title = {DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing},
author = {Qian Cao and Yahui Liu and Wei Bi and Yi Zhao and Ruihua Song and Xiting Wang and Ruiming Tang and Guorui Zhou and Han Li},
journal= {arXiv preprint arXiv:2601.09609},
year = {2026}
}