通过单向编辑控制语言模型中的对话风格
计算与语言
2026-03-05 v1 人工智能
摘要
控制大型语言模型(LLM)的风格属性仍具有挑战性,现有方法要么依赖提示工程,要么依赖后训练对齐。本文从表示工程的视角考察这一挑战,检验了以下假设:从情感语调到语言结构的不同风格属性,都编码为模型激活空间中的线性方向。我们在广泛的风格范围内提供了强有力的实证证据,基于此发现,提出一种轻量级、无需训练的方法实现精确风格控制。我们的做法支持线性风格组合,通过消除不良行为来增强安全性,并且经实验验证,在动力成本最小的前提下,实现高风格遵循度,同时保留核心能力。
引用
@article{arxiv.2603.03324,
title = {Controlling Chat Style in Language Models via Single-Direction Editing},
author = {Zhenyu Xu and Victor S. Sheng},
journal= {arXiv preprint arXiv:2603.03324},
year = {2026}
}