大型语言模型概念表征之间的跨模型可迁移性
计算与语言
2025-05-21 v2 人工智能
摘要
理解大型语言模型(LLM)的内部工作原理是当前的关键研究前沿。先前的研究表明,单个LLM的概念表征可以作为驾驶向量(SVs)来捕捉,从而实现对LLM行为的控制(例如,引导其生成有害内容)。我们的工作采用一种新颖的方法,通过探索不同LLM之间概念表征的复杂关系,呈现出类似巴塔哥拉学派洞穴寓言的平行。具体而言,我们引入一种线性变换方法来桥接这些表征,并提出三个关键发现:1)不同LLM之间的概念表征可以通过简单的线性变换进行有效对齐,通过SVs实现跨模型的有效迁移和行为控制。2)这种线性变换能够在概念之间普遍化,促进不同LLM中代表不同概念的SVs的对齐和控制。3)存在一种从弱到强的可迁移性,即从较小的LLM提取的SVs能够有效控制较大LLM的行为。
引用
@article{arxiv.2501.02009,
title = {Cross-model Transferability among Large Language Models on the Platonic Representations of Concepts},
author = {Youcheng Huang and Chen Huang and Duanyu Feng and Wenqiang Lei and Jiancheng Lv},
journal= {arXiv preprint arXiv:2501.02009},
year = {2025}
}
备注
ACL 2025 Main Camera Ready