中文

DynSess:面向角色扮演智能体的动态会话级评估与优化框架

计算与语言 2026-05-29 v1 人工智能

摘要

与大型语言模型进行角色扮演本质上是一个会话级任务,需要智能体在持续的多轮对话中维持角色身份和交互质量。然而,现有的评估和优化方法仍 largely 以轮次级为主,无法捕捉长期视角下的质量。我们提出DynSess,一个用于角色扮演智能体的统一会话级框架。DynSess-Eval 通过针对长期行为的评估标准对完整对话会话进行评分。利用其会话级奖励,我们通过多轮前瞻搜索构建高质量的训练轨迹,并训练 DynSess-Character 采用两种互补变体:DSPO (off-policy) 和 GSRPO (on-policy)。实验表明,DynSess-Eval 的对齐人类判断效果显著优于先前的评估器,而且盲测人类评估进一步表明,DynSess-Character 尽管使用了大大减少的参数,就能匹配最强角色模型,同时保持强大的角色一致性和交互能力。我们的数据集和代码将公开,以促进未来研究。

关键词

引用

@article{arxiv.2605.29256,
  title  = {DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing Agents},
  author = {Rongsheng Zhang and Jiji Tang and Junnan Ren and Zuyi Bao and Weijie Chen and Ruofan Hu and Zhou Zhao and Tangjie Lv and Yan Zhang},
  journal= {arXiv preprint arXiv:2605.29256},
  year   = {2026}
}