中文

通过激活工程识别和操纵大语言模型中的人格特征

计算与语言 2025-08-26 v2 人工智能

摘要

大语言模型(Large Language Models, LLMs)领域近年来迅速发展,驱动力来自更高的效率、可解释性以及安全使用需求。基于“激活工程”这一新颖方法,本研究探索了大语言模型中的人格修改,灵感来自诸如《Refusal in LLMs Is Mediated by a Single Direction》(arXiv:2406.11717)和《Steering Llama 2 via Contrastive Activation Addition》(arXiv:2312.06681)等研究。我们利用激活工程开发了一种方法,用于识别和调整与人格特征相关的激活方向,从而可能实现动态的人格微调。本工作旨在进一步深化对大语言模型可解释性的理解,同时审视此类发展的伦理影响。

关键词

引用

@article{arxiv.2412.10427,
  title  = {Identifying and Manipulating Personality Traits in LLMs Through Activation Engineering},
  author = {Rumi Allbert and James K. Wiles and Vlad Grankovsky},
  journal= {arXiv preprint arXiv:2412.10427},
  year   = {2025}
}