中文

通过概念激活向量控制大型语言模型

计算与语言 2025-01-13 v1

摘要

随着大型语言模型(LLMs)在各个领域的广泛部署,其生成输出的控制能力日益重要。这种控制涉及将LLM的输出与人类价值观和伦理原则保持一致,或为特定用户定制特定主题或风格的输出。现有的受控生成方法要么需要大量计算资源和 extensive trial-and-error,要么提供粗粒度的控制。本文提出了一种称为Generation with Concept Activation Vector (GCAV)的轻量级模型控制框架,确保在无需资源密集型微调的情况下实现精确控制。具体而言,GCAV首先为指定概念(例如有毒性)训练概念激活向量。在推理过程中,GCAV通过从激活层中移除有毒性概念向量来引导概念向量。来自不同视角的控制实验,包括毒性降低、情感控制、语言风格和主题控制,表明该框架在精细控制方面实现了最先进的性能,允许对单个样本的控制层和控制幅度进行细粒度调整。

关键词

引用

@article{arxiv.2501.05764,
  title  = {Controlling Large Language Models Through Concept Activation Vectors},
  author = {Hanyu Zhang and Xiting Wang and Chengao Li and Xiang Ao and Qing He},
  journal= {arXiv preprint arXiv:2501.05764},
  year   = {2025}
}