中文

大语言模型概念表征的横向迁移:来自柏拉图式概念表征的分析

系统与控制 2025-05-20 v1 系统与控制 图像与视频处理 信号处理

摘要

理解大语言模型(LLM)的内部工作原理是当前的关键研究前沿。先前的研究表明,单个 LLM 的概念表征可捕获为引导向量(SVs),从而实现对 LLM 行为的控制(例如引导其生成有害内容)。我们的工作采取了一种新颖的方法,通过探索不同 LLM 之间概念表征的复杂关系,呈现出一种类似于柏拉图《洞穴寓言》的平行。具体而言,我们引入一种线性变换方法来桥接这些表征,并提出了三个关键发现:1)不同 LLM 之间的概念表征可通过简单线性变换有效对齐,从而实现高效的横向迁移和通过 SVs 进行的行为控制。2)这种线性变换可推广到概念之间,促进了表示不同概念的 SVs 在 LLM 之间的对齐和控制。3)存在一种弱到强的横向迁移性,即从较小的 LLM 提取的 SVs 能有效控制较大 LLM 的行为。

关键词

引用

@article{arxiv.2501.02008,
  title  = {Integrated Strategy for Urban Traffic Optimization: Prediction, Adaptive Signal Control, and Distributed Communication via Messaging},
  author = {Ismail Zrigui and Samira Khoulji and Mohamed Larbi Kerkeb},
  journal= {arXiv preprint arXiv:2501.02008},
  year   = {2025}
}