通过解耦表示引导实现风格化与真实性的平衡
计算与语言
2025-08-08 v2
摘要
通过表示编辑实现大型语言模型(LLM)风格化响应的生成是一种具有细粒度输出控制潜力的方法。然而,存在一种内在权衡:施加独特风格往往会损害真实性。现有表示编辑方法通过简单注入风格信号,忽略了这一 collateral 影响,常常会污染模型核心真实性表示,从而导致答案正确性下降。我们称这种现象为风格化引起的真实性崩溃。我们将此问题归因于特定关键注意力头中风格与真实性方向之间的隐性耦合,提出了 StyliTruth 机制,以保持风格化的同时保持真实性。StyliTruth 通过正交减法过程将风格相关和真实相关的子空间在模型表示空间中分离。这种分解使我们能够在各自子空间内独立控制风格和真实性,最大限度地减少干扰。通过在每个子空间内设计自适应的、基于标记的引导向量,我们能够动态且精确地控制生成过程,以维持风格忠实性和真实性。我们在多种风格和语言上对该方法进行了验证。大量实验和分析表明,StyliTruth 显著减少了风格化引起的真实性崩溃,并在平衡风格遵循性与真实性方面超越了现有的推理时干预方法。
引用
@article{arxiv.2508.04530,
title = {Balancing Stylization and Truth via Disentangled Representation Steering},
author = {Chenglei Shen and Zhongxiang Sun and Teng Shi and Xiao Zhang and Jun Xu},
journal= {arXiv preprint arXiv:2508.04530},
year = {2025}
}