中文

MUSE:基于自演化轮廓与评分指导对齐的多域中文用户仿真

计算与语言 2026-04-16 v1

摘要

用户仿真器是可扩展训练和评估交互式 AI 系统的关键组件。然而,现有方法常依赖浅层用户画像,难以在长时间交互中维持人格一致性,且主要局限于英语或单领域场景。我们提出 MUSE,一个面向多域中文用户仿真框架,旨在生成符合人类、可控且在长时间交互中保持行为一致性的响应。首先,我们提出迭代轮廓自演化 (IPSE),通过比较和推理模拟轨迹与真实对话行为之间的差异,逐步优化用户画像。随后,我们应用角色反转监督微调以提高局部响应的真实性和人类化表达。为实现细粒度行为对齐,我们进一步训练一个专门的基于评分的奖励模型,并将其纳入评分引导的多轮强化学习中,该模型在对话层面优化仿真器,增强长期行为一致性。实验表明,MUSE 在 utterance 级别和 session 级别的评估中均 consistently 优于强基准,生成的响应在真实性、连贯性和人格一致性方面表现更佳,尤其在持续交互中表现出色。

关键词

引用

@article{arxiv.2604.13828,
  title  = {MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment},
  author = {Zihao Liu and Hantao Zhou and Jiguo Li and Jun Xu and Jiuchong Gao and Jinghua Hao and Renqing He and Peng Wang},
  journal= {arXiv preprint arXiv:2604.13828},
  year   = {2026}
}