中文

基于偏好排序的提示微调决策Transformer

机器学习 2023-05-17 v1 人工智能

摘要

提示微调(prompt-tuning)已成为将预训练模型适配下游任务或与人类偏好对齐的一种有前景的方法。提示学习在 NLP 中广泛应用,但由于 RL 提示中包含复杂的物理意义和环境特定信息,其在强化学习(RL)中的适用性有限。这些因素需要监督学习来模仿示范,并可能导致学习后意义丢失。此外,直接将提示微调方法扩展到 RL 具有挑战性,因为 RL 提示基于环境建模与分析来引导智能体行为,而非填补缺失信息,这使得像 NLP 中那样调整下游任务的提示格式不太可能带来显著改进。在本工作中,我们提出 Prompt-Tuning DT 算法,通过使用轨迹段作为提示来引导 RL 智能体获取环境信息,并通过黑盒微调优化提示以增强其包含更多相关信息的能力,从而使智能体做出更好的决策。我们的方法涉及随机采样高斯分布以微调提示轨迹的元素,并使用偏好排序函数寻找优化方向,从而提供更富信息的提示并引导智能体在目标环境中朝向特定偏好。大量实验表明,仅学习 0.03% 的参数,Prompt-Tuning DT 在低数据场景下取得了与全模型微调相当甚至更优的性能。我们的工作推动了提示微调在 RL 中的进展,为针对特定偏好任务优化大型 RL 智能体提供了有前景的方向。

关键词

引用

@article{arxiv.2305.09648,
  title  = {Prompt-Tuning Decision Transformer with Preference Ranking},
  author = {Shengchao Hu and Li Shen and Ya Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2305.09648},
  year   = {2023}
}

备注

18 pages