LLaMA-Excitor:通过间接特征交互的通用指令微调
计算机视觉与模式识别
2024-04-02 v1 人工智能
计算与语言
摘要
现有的微调 LLM 的方法,如 Adapter、Prefix-tuning 和 LoRA,通过引入额外模块或额外的输入序列来注入新技能或知识,可能会损害 LLM 的固有能力。在本文中,我们提出了 LLaMA-Excitor,这是一种轻量级方法,通过逐渐将更多注意力集中在有价值的信息上来激发 LLM 更好地遵循指令的潜力。具体而言,LLaMA-Excitor 不直接改变 transformer 结构自注意力计算过程中的中间隐藏状态。我们将 Excitor 块设计为 LLM 自注意力中相似度分数计算的旁路模块,以重构键并通过可学习的提示改变值的重要性。LLaMA-Excitor 确保了对输入指令的自适应额外注意力分配,从而在低质量指令遵循数据集上微调 LLM 时有效保留了 LLM 的预训练知识。此外,我们统一了多模态微调和纯语言微调的建模,将 LLaMA-Excitor 扩展为强大的视觉指令跟随器,而无需复杂的多模态对齐。我们提出的方法在纯语言和多模态微调实验场景中进行了评估。值得注意的是,LLaMA-Excitor 是唯一一种在 MMLU 基准上保持基本能力同时取得显著提升(+6%)的方法。在视觉指令微调中,我们在 MSCOCO 上取得了 157.5 CIDEr 的新 SOTA 图像描述性能,并在 ScienceQA 上取得了与具有更多参数和广泛视觉-语言预训练的前沿模型相当的性能(88.39%)。
关键词
引用
@article{arxiv.2404.00913,
title = {LLaMA-Excitor: General Instruction Tuning via Indirect Feature Interaction},
author = {Bo Zou and Chao Yang and Yu Qiao and Chengbin Quan and Youjian Zhao},
journal= {arXiv preprint arXiv:2404.00913},
year = {2024}
}
备注
This paper is accepted by CVPR 2024