CogDual:通过隐式规则奖励强化学习增强 LLM 的双重认知
计算与语言
2025-07-24 v1
摘要
角色扮演语言代理(RPLA)是大型语言模型(LLM)的一个重要应用方向。现有方法通常依赖提示工程或监督微调以实现模型在特定情境中模拟角色行为,但往往忽视驱动这些行为的底层认知机制。受认知心理学启发,本文引入\textbf{CogDual},一种新型 RPLA,采用\textit{认知后响应}推理范式。通过联合建模外部情境意识与内部自我意识,CogDual 生成更具角色一致性和情境对齐性的响应。为进一步优化性能,我们采用两种通用奖励方案进行强化学习,以适应开放域文本生成。广泛的在 CoSER 框架、Cross-MR 和 LifeChoice 上的实验表明,CogDual 在 diverse role-playing 任务上均显著优于现有基线,并能有效泛化。
引用
@article{arxiv.2507.17147,
title = {CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards},
author = {Cheng Liu and Yifei Lu and Fanghua Ye and Jian Li and Xingyu Chen and Feiliang Ren and Zhaopeng Tu and Xiaolong Li},
journal= {arXiv preprint arXiv:2507.17147},
year = {2025}
}