中文

PILLOW:通过提示匹配增强高效指令微调

计算与语言 2024-10-08 v2

摘要

指令微调通常被用于使大型语言模型(LLM)适应各种任务。然而,该技术通常需要大量计算资源,使得个人或小型机构难以部署。最近,低秩微调(LoRA)成为一种有前景的替代方案,它以更低的资源开销提供了与全量微调相当的能力。然而,通过对 LoRA 进行微调来获得令人满意的性能是一项极具挑战性的任务。在本文中,我们提出了 PILLOW,旨在利用 LLM 的上下文学习能力,通过基于判别的提示方法来提升 LoRA 的性能。PILLOW 集成了一个匹配网络,该网络从用户定义的提示池中选择提示,将所选提示与用户指令拼接作为输入,并使用 LoRA 微调后的 LLM 执行推理。PILLOW 采用强化学习进行训练,在各项评估指标上表现出与传统指令微调方法相当的性能,且仅需消费级 GPU 资源,大幅降低了计算成本。

关键词

引用

@article{arxiv.2312.05621,
  title  = {PILLOW: Enhancing Efficient Instruction Fine-tuning via Prompt Matching},
  author = {Zhenting Qi and Xiaoyu Tan and Shaojie Shi and Chao Qu and Yinghui Xu and Yuan Qi},
  journal= {arXiv preprint arXiv:2312.05621},
  year   = {2024}
}

备注

Accepted by EMNLP 2023 (Industry Track), Oral Presentation