中文

CPO:通过比较策略优化解决角色扮演对话中的奖励歧义

计算与语言 2025-08-13 v1

摘要

强化学习精调(RLFT)在具有可验证答案的任务(如代码生成、数学推理)中取得了显著的成功,但在开放式主观任务(如角色扮演对话)中却面临挑战。传统的奖励建模方法依赖独立的样本打分,面临两个挑战:主观评估标准和不稳定的奖励信号。针对人类评估天然结合显式标准与隐式比较判断的洞见,我们提出比较策略优化(CPO)。CPO重新定义了奖励评估范式,使其从样本级打分转向比较组级打分。在同一原则下,我们引入CharacterArena评估框架,包含两个阶段:(1)情境化多轮角色扮演模拟,和(2)轨迹级比较评估。通过将主观评分操作化为客观轨迹比较,CharacterArena最小化情境偏差,实现更稳健、更公平的性能评估。在CharacterEval、CharacterBench和CharacterArena上的实证结果表明,CPO有效缓解了奖励歧义,显著提升了对话质量。

关键词

引用

@article{arxiv.2508.09074,
  title  = {CPO: Addressing Reward Ambiguity in Role-playing Dialogue via Comparative Policy Optimization},
  author = {Xinge Ye and Rui Wang and Yuchuan Wu and Victor Ma and Feiteng Fang and Fei Huang and Yongbin Li},
  journal= {arXiv preprint arXiv:2508.09074},
  year   = {2025}
}