中文

Q-Probe:一种面向语言模型奖励最大化的轻量级方法

机器学习 2024-06-04 v2

摘要

我们提出了一种名为 Q-probing 的方法,用于适配预训练语言模型以最大化特定任务的奖励函数。从宏观层面看,Q-probing 介于微调等较重的方法与少样本提示等较轻的方法之间,但也可与两者结合使用。其核心思想是在模型的嵌入空间中学习一个简单的线性函数,用于对候选补全进行重加权。我们从理论上证明,随着样本数量的增加,该采样过程等价于 Q-probe 的 KL 约束最大化。为了训练 Q-probe,我们考虑了奖励建模或一类基于重要性加权策略梯度的直接策略学习目标。借助该技术,我们在具有真实奖励的领域(代码生成)以及由偏好数据定义的隐式奖励领域均取得了性能提升,在数据受限场景下甚至优于微调。此外,Q-probe 可以在 API 之上进行训练,因为它仅假设可访问采样和嵌入。代码:https://github.com/likenneth/q_probe 。

关键词

引用

@article{arxiv.2402.14688,
  title  = {Q-Probe: A Lightweight Approach to Reward Maximization for Language Models},
  author = {Kenneth Li and Samy Jelassi and Hugh Zhang and Sham Kakade and Martin Wattenberg and David Brandfonbrener},
  journal= {arXiv preprint arXiv:2402.14688},
  year   = {2024}
}