中文

通过定向表示编辑实现大语言模型的精确属性强度控制

人工智能 2026-02-19 v2 计算与语言 机器学习

摘要

精确的属性强度控制——生成具有特定用户定义属性强度的大语言模型(LLM)输出——对于适应多样化用户期望的 AI 系统至关重要。当前的 LLM 对齐方法通常仅提供方向性或开放性指导,无法可靠实现确切的属性强度。我们通过三个关键设计来解决这一限制:(1)将精确属性强度控制重新表述为目标到达问题,而非简单最大化;(2)通过时序差分学习训练一个轻量级价值函数,从部分生成中预测最终属性强度得分,以引导 LLM 输出;(3)对隐藏表示执行梯度基插,精准导航模型以达到特定属性强度目标。我们的方法实现了对属性强度的细粒度、连续控制,超越简单的方向性对齐。在 LLaMA-3.2-3b 和 Phi-4-mini 上的实验确认了该方法能够以高精度将文本生成引导至用户指定的属性强度。最后,我们在三个下游任务中展示了效率提升:偏好数据合成、帕累托前沿逼近与优化,以及对齐行为蒸馏以实现无干预推理。我们的代码已在 https://github.com/Pre-Control/pre-control 上提供。

关键词

引用

@article{arxiv.2510.12121,
  title  = {Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing},
  author = {Rongzhi Zhang and Liqin Ye and Yuzhao Heng and Xiang Chen and Tong Yu and Lingkai Kong and Sudheer Chava and Chao Zhang},
  journal= {arXiv preprint arXiv:2510.12121},
  year   = {2026}
}