通过 Gisting 研究 HyperTuning 的有效性
计算与语言
2024-02-27 v1
摘要
Gisting (Mu et al., 2023) 是一种简单的方法,通过修改注意力掩码训练模型将信息压缩到更少的 token 表示中,可作为训练基于 Transformer 的超网络(hypernetworks)的一种经济途径。我们介绍了 HyperLlama,这是一组基于 Llama-2 模型构建的、采用 Gisting 技术的超网络,能够根据少样本(few-shot)输入生成特定任务的软前缀(soft prefixes)。在 P3、Super-NaturalInstructions 和 Symbol Tuning 数据集上的实验表明,HyperLlama 模型能有效地将少样本示例中的信息压缩到软前缀中。然而,它们的性能仍低于对少样本上下文示例进行全注意力机制的多任务微调语言模型。我们还表明,HyperLlama 生成的软前缀可作为进一步前缀微调的更好初始化。总体而言,基于 Gisting 的超网络经济且易于实现,但实证表现参差不齐。
引用
@article{arxiv.2402.16817,
title = {Investigating the Effectiveness of HyperTuning via Gisting},
author = {Jason Phang},
journal= {arXiv preprint arXiv:2402.16817},
year = {2024}
}