中文

通过可解释的角色扮演引导提升大语言模型推理能力

计算与语言 2025-09-30 v2 人工智能

摘要

角色扮演已成为增强大语言模型推理能力的有效技术。然而,现有方法主要依赖提示工程,这通常缺乏稳定性和可解释性。在本文中,我们引入了稀疏自编码器角色扮演引导,这是一个新颖的框架,用于识别和操控与角色扮演行为相关的模型内部特征。我们的方法从角色扮演提示中提取潜在表示,基于激活模式选择最相关的特征,并构建一个可以以可控强度注入模型残差流的引导向量。我们的方法能够对角色特定行为进行细粒度控制,并揭示了角色信息如何影响内部模型激活。跨各种推理基准和模型规模的广泛实验证明了性能的持续提升。值得注意的是,在零样本思维链设置下,Llama3.1-8B在CSQA上的准确率从31.86%提高到39.80%,而Gemma2-9B在SVAMP上的准确率从37.50%提高到45.10%。这些结果凸显了SRPS在增强LLM推理能力方面的潜力,与传统的基于提示的角色扮演相比,它提供了更好的可解释性和稳定性。

关键词

引用

@article{arxiv.2506.07335,
  title  = {Improving LLM Reasoning through Interpretable Role-Playing Steering},
  author = {Anyi Wang and Dong Shu and Yifan Wang and Yunpu Ma and Mengnan Du},
  journal= {arXiv preprint arXiv:2506.07335},
  year   = {2025}
}

备注

Accepted at EMNLP 2025 Findings