中文

持久人设?扩展交互中的角色扮演、指令遵循与安全性

计算与语言 2026-01-21 v2

摘要

分配人设的大型语言模型(LLMs)被用于教育、医疗和社会人口模拟等领域。然而,它们通常仅在反映真实世界使用的短单轮设置中进行评估。我们引入一种评估协议,将长人设对话(超过 100 轮)与评估数据集相结合,创建能够稳健测量长上下文效应的对话条件基准。随后,我们研究对话长度对七种最先进的开源和闭源权重大语言模型的人设保真度、指令遵循和安全性的影响。我们发现人设保真度在对话过程中会退化,尤其是在目标导向对话中,模型必须同时维持人设保真度和指令遵循。我们识别出保真度与指令遵循之间的权衡,非人设基线最初优于人设分配模型;随着对话推进且保真度逐渐消退,人设响应变得越来越接近基线响应。我们的发现凸显了人设应用在扩展交互中的脆弱性,我们的工作提供了系统测量此类失败的协议。

关键词

引用

@article{arxiv.2512.12775,
  title  = {Persistent Personas? Role-Playing, Instruction Following, and Safety in Extended Interactions},
  author = {Pedro Henrique Luz de Araujo and Michael A. Hedderich and Ali Modarressi and Hinrich Schuetze and Benjamin Roth},
  journal= {arXiv preprint arXiv:2512.12775},
  year   = {2026}
}

备注

31 pages, 35 figures, accepted to EACL 2026