探测后编辑大语言模型的响应性格
计算与语言
2025-07-30 v2
摘要
大语言模型(LLMs)已展现出生成模拟一致性格特征响应的潜力。尽管已有大量研究尝试通过输出导向评估来分析性格表达,但关于这些特征如何在 LLM 参数内部编码的认识仍有限。本文引入一种逐层探测框架,系统性地调查 LLMs 在模拟性格以作出响应方面的逐层能力。我们在 PersonalityEdit 数据集上对 11 个开源 LLMs 进行探测实验,发现 LLMs 在其中间和上层主要用于模拟响应性格,其中指令调优模型在性格特征的分离方面略显清晰。此外,通过将训练得到的探测超平面解释为每个性格类别的逐层边界,我们提出一种逐层扰动方法,用于在推理期间编辑 LLMs 表达的性格。我们的结果表明,即使提示明确指定特定性格,我们的方法仍能成功改变 LLMs 的响应性格。有趣的是,不同性格间的转换难度存在显著差异,这与我们的探测实验中的表征距离相吻合。最后,我们进行了全面的 MMLU 基准测试评估和时间开销分析,表明我们提出的性格编辑方法仅在一般能力方面轻微降低,同时保持低训练成本和可接受的推理延迟。我们的代码已公开于 https://github.com/universe-sky/probing-then-editing-personality
引用
@article{arxiv.2504.10227,
title = {Probing then Editing Response Personality of Large Language Models},
author = {Tianjie Ju and Zhenyu Shao and Bowen Wang and Yujia Chen and Zhuosheng Zhang and Hao Fei and Mong-Li Lee and Wynne Hsu and Sufeng Duan and Gongshen Liu},
journal= {arXiv preprint arXiv:2504.10227},
year = {2025}
}
备注
Accepted at COLM 2025