中文

Nano:用于少样本语言模型控制的嵌套式人在回路奖励学习

计算与语言 2023-09-26 v3

摘要

预训练语言模型已展现出卓越的语言生成能力。然而,现实世界任务常需控制生成文本的分布,以缓解偏见、促进公平并实现个性化。现有的生成文本分布控制技术仅适用于已量化的分布,其要求预定义类别、分布比例或存在遵循所需分布的语料库。但许多重要分布(如个人偏好)是未量化的。本工作中,我们提出 Nano——一种持续从人类反馈中学习的少样本人在回路训练算法,以解决遵循任意分布(量化与未量化)生成文本的问题。与以往工作相比,Nano 在单一主题/属性以及量化分布控制上均取得了最先进(state-of-the-art)结果。我们还表明,Nano 能够学习未量化分布,实现个性化,并以高样本效率捕捉不同个体间个人偏好的差异。

关键词

引用

@article{arxiv.2211.05750,
  title  = {Nano: Nested Human-in-the-Loop Reward Learning for Few-shot Language Model Control},
  author = {Xiang Fan and Yiwei Lyu and Paul Pu Liang and Ruslan Salakhutdinov and Louis-Philippe Morency},
  journal= {arXiv preprint arXiv:2211.05750},
  year   = {2023}
}

备注

Accepted to ACL Findings 2023