中文

推理时策略适配器(IPA):无需微调即可定制极端规模语言模型

计算与语言 2023-12-07 v2

摘要

尽管极端规模语言模型在各种语言任务上展现出卓越性能,但通过纯提示对这些语言模型的控制程度往往有限。直接微调此类语言模型可有效对其进行定制,但这可能极其昂贵(如 GPT-3)或对广大社区甚至不可行(如 GPT-4)。我们提出推理时策略适配器(Inference-time Policy Adapters, IPA),其无需微调即可高效定制 GPT-3 等语言模型。IPA 在解码时通过一个轻量级策略适配器引导大型基础模型,该适配器经训练以强化学习优化任意用户目标。在毒性降低和词汇受限生成等五项具有挑战性的文本生成任务上,IPA 相较开箱即用语言模型持续带来显著改进。它优于具有竞争力的基线方法,有时甚至包括昂贵的微调。特别地,用 IPA 定制 GPT-2 可优于 GPT-3,而用 IPA 定制 GPT-3 相较 GPT-3(有时甚至相较 GPT-4)带来大幅性能提升。我们颇具前景的结果凸显了 IPA 作为定制极端规模语言模型之轻量级替代方案的潜力。

关键词

引用

@article{arxiv.2305.15065,
  title  = {Inference-Time Policy Adapters (IPA): Tailoring Extreme-Scale LMs without Fine-tuning},
  author = {Ximing Lu and Faeze Brahman and Peter West and Jaehun Jang and Khyathi Chandu and Abhilasha Ravichander and Lianhui Qin and Prithviraj Ammanabrolu and Liwei Jiang and Sahana Ramnath and Nouha Dziri and Jillian Fisher and Bill Yuchen Lin and Skyler Hallinan and Xiang Ren and Sean Welleck and Yejin Choi},
  journal= {arXiv preprint arXiv:2305.15065},
  year   = {2023}
}

备注

EMNLP 2023