中文

基于对比度SAE的特征级人格控制:面向角色扮演LLM的性状激活路由

计算与语言 2026-03-30 v2

摘要

在角色扮演代理(RPA)中实现人格控制通常通过注入人格描述和记忆的训练-free方法(如通过提示词或检索增强生成)或在人格特定语料库上进行的监督微调(SFT)来实现。虽然SFT可能有效,但需要人格标记数据以及针对新角色的重新训练,从而限制了灵活性。相比之下,基于提示和RAG的信号易于应用,但在长对话中可能被稀释,导致人格行为漂移甚至不一致。为此,我们提出了一种对比稀疏自动编码器(SAE)框架,通过对齐Big Five 30-facet模型学习特征级人格控制向量。构建了一个包含15,000个样本且控制泄漏的语料库,以为每个特征提供平衡的监督。所学向量集成到模型的残差空间,并由性状激活路由模块动态选择,从而实现精确且可解释的人格引导。在大型语言模型(LLM)上的实验表明,所提出的方法在上下文化环境中保持稳定的字符忠实度和输出质量,优于对比激活增加(CAA)和仅限提示词的基线。组合的SAE+提示配置实现了最佳整体性能,确认对比训练的潜在向量可在保持对话连贯性的同时增强人格控制。数据集可在https://github.com/lunat5078/BigFive-Personality-Facets-Dataset 获取。

关键词

引用

@article{arxiv.2602.19157,
  title  = {Facet-Level Persona Control by Trait-Activated Routing with Contrastive SAE for Role-Playing LLMs},
  author = {Wenqiu Tang and Zhen Wan and Takahiro Komamizu and Ichiro Ide},
  journal= {arXiv preprint arXiv:2602.19157},
  year   = {2026}
}

备注

Accepted in PAKDD 2026 special session on Data Science :Foundation and Applications