中文

通过信息论理解角色扮演模型的泛化

机器学习 2026-04-14 v2 人工智能 计算与语言

摘要

角色扮演模型(Role-playing models, RPMs)在实际应用中广泛使用,但在野外部署时性能下降。这一降级可归因于分布迁移,包括用户迁移、角色迁移和对话组成迁移。现有方法如LLM-as-a-judge在诊断这些迁移如何影响RPM泛化方面不足,因而缺乏形式框架来描述RPM泛化行为。为填补这一差距,我们引入一种信息论度量,称为基于推理的有效互信息差(reasoning-based effective mutual information difference, R-EMID),用于以可解释方式衡量RPM性能降解。我们还导出R-EMID的上界,以预测RPM最坏情况的泛化性能,并从理论上揭示了各种迁移如何导致RPM性能降级。此外,我们提出了一个协同演化强化学习框架,用于适应性地建模用户、角色和对话上下文之间的联系,从而增强对对话响应生成概率的估计,这对于计算R-EMID至关重要。最后,我们使用R-EMID评估了各种RPM的泛化性能,发现用户迁移是所有迁移中风险最高的,而强化学习是增强RPM泛化最有效的方法。

关键词

引用

@article{arxiv.2512.17270,
  title  = {Understanding Generalization in Role-Playing Models via Information Theory},
  author = {Yongqi Li and Hao Lang and Fei Huang and Tieyun Qian and Yongbin Li},
  journal= {arXiv preprint arXiv:2512.17270},
  year   = {2026}
}

备注

Accepted to ACL 2026 (Findings), camera-ready version