通过激活引导提升大语言模型的跨任务迁移能力
计算与语言
2025-07-18 v1
摘要
大语言模型(LLM)在通过提示技术展示了利用预训练知识的强大能力, 但在面对未见任务时, 尤其是在数据稀缺的情境下, 往往表现不佳。虽然跨任务的零样本学习提供了直接的跨任务知识迁移解决方案, 但仍面临鲁棒性、可扩展性和效率等关键挑战。本文我们探讨了通过潜在空间引导而无需参数更新或输入扩张即可实现跨任务迁移的可能性。通过分析 LLM 潜在空间中的激活模式, 我们观察到由零样本学习诱导的增强激活在不同任务间具有一致的模式。灵感来自这些发现, 我们提出了 CAST(Cross-task Activation Steering Transfer)框架, 通过操控模型内部激活状态来实现有效的跨任务迁移。我们的框架首先从高资源任务中选择具有影响力且多样化的样本, 然后利用其对比性表示增强的激活来适应低资源任务。广泛的实验表明, 在跨域和跨语言迁移设置中, 我们的方法优于竞争性基线, 并在可扩展性和计算成本方面表现出色。
引用
@article{arxiv.2507.13236,
title = {Enhancing Cross-task Transfer of Large Language Models via Activation Steering},
author = {Xinyu Tang and Zhihao Lv and Xiaoxue Cheng and Junyi Li and Wayne Xin Zhao and Zujie Wen and Zhiqiang Zhang and Jun Zhou},
journal= {arXiv preprint arXiv:2507.13236},
year = {2025}
}