中文

HER:用于 LLM 角色扮演的人类化推理与强化学习

机器学习 2026-04-30 v4 人工智能

摘要

LLM 角色扮演,即使用 LLMs 模拟特定人物,以在各种应用中实现陪伴、内容创作和数字游戏等功能,已成为一种关键能力。虽然当前模型有效地捕获角色语调和知识,但在模拟其行为背后的内在思考方面仍存在挑战。针对 LLM 角色扮演中的认知级模拟,先前的工作主要存在两个不足:缺乏高质量推理痕迹的数据,以及缺乏与人类偏好一致的可靠奖励信号。本文提出了 HER,一个用于认知级人物模拟的统一框架。HER 引入双层思维,区分角色的第一人称思考与 LLM 的第三人称思考。为弥合这些差距,我们通过逆向工程构建了推理增强的角色扮演数据,并构建了人类对齐的原则和奖励模型。利用这些资源,我们基于 Qwen3-32B 通过监督学习和强化学习训练 HER 模型。广泛的实验验证了我们方法的有效性。值得注意的是,我们的模型显著优于 Qwen3-32B 基线,在 CoSER 数据集上实现了 30.26 的提升,在 Minimax Role-Play Bench 上实现了 14.97% 的增益。我们的数据集、原则和模型已发布,以促进未来研究。

关键词

引用

@article{arxiv.2601.21459,
  title  = {HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing},
  author = {Chengyu Du and Xintao Wang and Aili Chen and Weiyuan Li and Rui Xu and Junteng Liu and Zishan Huang and Rong Tian and Zijun Sun and Yuhao Li and Liheng Feng and Deming Ding and Pengyu Zhao and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2601.21459},
  year   = {2026}
}

备注

Findings of ACL, 2026