中文

面向 LLM 推理时的可控且可解释的性格滑块

计算与语言 2026-03-05 v1 人工智能

摘要

将大型语言模型(LLM)与特定人格档案对齐,通常依赖高成本且单一化的监督微调(SFT)或 RLHF。虽然有效,但这些方法需要为每个目标人格档案训练独立模型。推理时的激活引导提供了一种参数高效的替代方案,然而,朴素的方法由于向量干扰,无法同时控制多个特征。本文提出一个模块化框架,实现连续、多维度的人格控制。我们的核心创新是顺序自适应引导(SAS):一种通过在后续探针上对 prior interventions 移位后的残差流进行训练来对正交化引导向量的方法。这一方法将引导向量转化为可重用的原语,允许用户仅通过调整 alpha 系数即可即时合成复杂且高保真度的人格档案。我们在 Big Five 人格特质上进行验证,结果表明该方法在目标遵循度和连贯性方面均优于朴素基线,实现了无需更新模型参数的精确、整体性的人格调制。

关键词

引用

@article{arxiv.2603.03326,
  title  = {Controllable and explainable personality sliders for LLMs at inference time},
  author = {Florian Hoppe and David Khachaturov and Robert Mullins and Mark Huasong Meng},
  journal= {arXiv preprint arXiv:2603.03326},
  year   = {2026}
}

备注

20 pages, 18 figures