CRPO:面向角色化智能体的角色导向组相对政策优化
计算与语言
2026-05-26 v1
摘要
近期强化学习(RL)进展,尤其是组相对政策优化(GRPO),显著提升了大语言模型的推理能力。但将这些以问题为导向的优化方法应用于角色扮演智能体常导致角色保真度丢失和风格塌陷,因为其优先考虑情境特定效用而非人格对齐。为此,我们提出角色导向组相对政策优化(CRPO),旨�将 RL 目标重新对齐角色扮演任务。CRPO 通过三种机制提升角色区分度:解耦任务逻辑与风格奖励以消除梯度冲突、基于角色复杂度动态调整优化约束、并利用通用响应作为负基线以防止模型回归到常见分布。大量实验表明,CRPO 在一致性、情感等方面优于现有方法。
引用
@article{arxiv.2605.25511,
title = {CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents},
author = {Yihong Tang and Kehai Chen and Liang Yue and Benyou Wang and Min Zhang},
journal= {arXiv preprint arXiv:2605.25511},
year = {2026}
}