使用 INSTINCT:基于神经 Bandit 与 Transformer 耦合的 LLM 指令优化
机器学习
2024-06-25 v3 人工智能
计算与语言
摘要
大语言模型(LLM)已展现出卓越的指令遵循能力,并在各类应用中取得令人印象深刻的性能。然而,LLM 的性能严重依赖于所给指令,而这些指令通常需耗费大量人力手动调优。近期工作采用查询高效的贝叶斯优化(BO)算法自动优化提供给黑盒 LLM 的指令。但是,当优化高度复杂(如高维)的目标函数(例如将指令映射到 LLM 性能的函数)时,BO 通常表现不佳。这主要由于 BO 用作目标函数代理的高斯过程(GP)表达能力有限。同时,反复研究表明神经网络(NN)尤其是预训练 transformer 具有强大表达能力,可建模高度复杂函数。因此,我们采用一种神经 bandit 算法,用 NN 代理替代 BO 中的 GP 来优化黑盒 LLM 的指令。更重要的是,该神经 bandit 算法使我们能自然地将 NN 代理与预训练 transformer(即开源 LLM)学到的隐表示相耦合,显著提升了其性能。这促使我们提出基于神经 Bandit 与 Transformer 耦合的指令优化(INSTINCT)算法。我们对 ChatGPT 进行指令优化,并通过大量实验表明 INSTINCT 在不同任务(如各类指令归纳任务与改进零样本思维链指令的任务)中持续优于基线。我们的代码见 https://github.com/xqlin98/INSTINCT。
引用
@article{arxiv.2310.02905,
title = {Use Your INSTINCT: INSTruction optimization for LLMs usIng Neural bandits Coupled with Transformers},
author = {Xiaoqiang Lin and Zhaoxuan Wu and Zhongxiang Dai and Wenyang Hu and Yao Shu and See-Kiong Ng and Patrick Jaillet and Bryan Kian Hsiang Low},
journal= {arXiv preprint arXiv:2310.02905},
year = {2024}
}
备注
Accepted to ICML 2024