Text-to-LoRA:即时 Transformer 适配
机器学习
2025-06-10 v2 人工智能
摘要
虽然基础模型为快速内容创作提供了通用工具,但它们通常需要针对特定任务进行调适。传统方法需要精心挑选数据集并反复微调底层模型。微调技术使实践者能够为许多新应用适配基础模型,但需要昂贵且耗时的训练,而且对超参数选择敏感。为克服这些限制,我们引入 Text-to-LoRA (T2L),一种能根据目标任务的自然语言描述即时适配大型语言模型 (LLM) 的模型。T2L 是一个超网络,能够在一次低成本的前向传播中构造 LoRA。我们在 9 个预训练 LoRA 适配器 (GSM8K、Arc 等) 上训练 T2L,随后表明,临时重构的 LoRA 实例在相应测试集上性能与任务特定适配器相当。此外,T2L 能够压缩数百个 LoRA 实例,并零-shot 推广到完全未见的任务。这一方法为 democratizing foundation model specialization 提供了重要一步,使语言基础的适配无需大量计算资源。我们的代码已公开于 https://github.com/SakanaAI/text-to-lora
引用
@article{arxiv.2506.06105,
title = {Text-to-LoRA: Instant Transformer Adaption},
author = {Rujikorn Charakorn and Edoardo Cetin and Yujin Tang and Robert Tjarko Lange},
journal= {arXiv preprint arXiv:2506.06105},
year = {2025}
}
备注
Accepted at ICML 2025