TeleLoRA:跨大语言模型的模型特定对齐迁移
机器学习
2025-03-27 v1 计算与语言
摘要
缓解大语言模型(LLM)中的特洛伊木马是众多任务之一,在这些任务中,不同 LLM 具有不同的特洛伊木马触发器与需被消除的触发行为,因此对齐数据具有模型特定性。本文提出 TeleLoRA(Teleporting Low-Rank Adaptation,迁移式低秩自适应),一种新颖的框架,可在多个 LLM 之间协同利用模型特定的对齐数据,从而在未见 LLM 且无对齐数据的情况下实现零样本特洛伊木马缓解。TeleLoRA 通过利用跨多个 LLM 的局部激活信息,学习一个统一的 LoRA 适配器权重生成器。该生成器被设计为置换对称的,以泛化至具有不同架构与规模的模型。我们对模型设计进行了内存效率优化,使其能够以最小计算资源对大规模 LLM 进行学习。在 LLM 特洛伊木马缓解基准上的实验表明,TeleLoRA 在有效降低攻击成功率的同时,保持了模型的良性性能。
引用
@article{arxiv.2503.20228,
title = {TeleLoRA: Teleporting Model-Specific Alignment Across LLMs},
author = {Xiao Lin and Manoj Acharya and Anirban Roy and Susmit Jha},
journal= {arXiv preprint arXiv:2503.20228},
year = {2025}
}