大语言模型概念表征的横向迁移:来自柏拉图式概念表征的分析
系统与控制
2025-05-20 v1 系统与控制
图像与视频处理
信号处理
摘要
理解大语言模型(LLM)的内部工作原理是当前的关键研究前沿。先前的研究表明,单个 LLM 的概念表征可捕获为引导向量(SVs),从而实现对 LLM 行为的控制(例如引导其生成有害内容)。我们的工作采取了一种新颖的方法,通过探索不同 LLM 之间概念表征的复杂关系,呈现出一种类似于柏拉图《洞穴寓言》的平行。具体而言,我们引入一种线性变换方法来桥接这些表征,并提出了三个关键发现:1)不同 LLM 之间的概念表征可通过简单线性变换有效对齐,从而实现高效的横向迁移和通过 SVs 进行的行为控制。2)这种线性变换可推广到概念之间,促进了表示不同概念的 SVs 在 LLM 之间的对齐和控制。3)存在一种弱到强的横向迁移性,即从较小的 LLM 提取的 SVs 能有效控制较大 LLM 的行为。
引用
@article{arxiv.2501.02008,
title = {Integrated Strategy for Urban Traffic Optimization: Prediction, Adaptive Signal Control, and Distributed Communication via Messaging},
author = {Ismail Zrigui and Samira Khoulji and Mohamed Larbi Kerkeb},
journal= {arXiv preprint arXiv:2501.02008},
year = {2025}
}