中文

PromptIntern:内部化递归提示以节省大型语言模型微调中的推理成本

计算与语言 2024-10-17 v2 人工智能 机器学习

摘要

近期大型语言模型(LLMs)微调技术的进展极大提升了其在特定领域任务中的应用。尽管取得了成功,但微调仍依赖重复且冗长的提示,这会导致计算成本增加、资源需求提升以及推理速度减慢。本文提出了一种新方法,PromptIntern通过在模型微调期间内置提示知识来实现高效推理并节省成本。不同于对普通模型进行提示压缩,PromptIntern旨在将递归提示直接嵌入模型参数中。我们设计的微调管线包括指令模板压缩、少量示例吸收以及渐进式内置策略,有效减少了推理时对复杂提示的需求。针对具有挑战性的NL2Code任务进行全面实验表明,我们的方法将输入标记数减少超过90%,推理速度提升4.2倍,推理成本降低88.3%。

关键词

引用

@article{arxiv.2407.02211,
  title  = {PromptIntern: Saving Inference Costs by Internalizing Recurrent Prompt during Large Language Model Fine-tuning},
  author = {Jiaru Zou and Mengyu Zhou and Tao Li and Shi Han and Dongmei Zhang},
  journal= {arXiv preprint arXiv:2407.02211},
  year   = {2024}
}

备注

This paper has been accepted by EMNLP 2024