中文

UniCreative:通过无参考强化学习统一长篇逻辑与短篇亮点

人工智能 2026-04-08 v1

摘要

创意写作中的一个基本挑战在于调和维持长篇叙事全局连贯性与保留短篇文本局部表现力之间的固有张力。长上下文生成需要显式的宏观规划,而短篇创意往往需要自发的、无约束的表达。然而,现有的对齐范式通常采用静态奖励信号,并严重依赖高质量监督数据,而后者成本高昂且难以扩展。为此,我们提出了 UniCreative,一个统一的无参考强化学习框架。我们首先引入了 AC-GenRM,一种自适应约束感知奖励模型,动态综合查询特定标准以提供细粒度的偏好判断。利用这些信号,我们提出了 ACPO,一种策略优化算法,使模型在对齐人类偏好的同时覆盖内容质量与结构范式,而无需监督微调和真实参考。实证结果表明 AC-GenRM 与专家评估高度一致,而 ACPO 显著提升了多种写作任务的性能。关键的是,我们的分析揭示了一种涌现的元认知能力:模型学会了自主区分需要严格规划的任务与倾向于直接生成的任务,验证了我们直接对齐方法的有效性。

关键词

引用

@article{arxiv.2604.05517,
  title  = {UniCreative: Unifying Long-form Logic and Short-form Sparkle via Reference-Free Reinforcement Learning},
  author = {Xiaolong Wei and Zerun Zhu and Simin Niu and Xingyu Zhang and Peiying Yu and Changxuan Xiao and Yuchen Li and Jicheng Yang and Zhejun Zhao and Chong Meng and Long Xia and Daiting Shi},
  journal= {arXiv preprint arXiv:2604.05517},
  year   = {2026}
}

备注

Accepted to Findings of ACL 2026