基于实时反馈的指令遵循持续学习
计算与语言
2023-12-07 v2 人工智能
机器学习
摘要
我们提出并部署了一种方法,用于在协作交互过程中,根据用户提供的反馈持续训练一个指令遵循智能体。在交互过程中,人类用户使用自然语言指示智能体,并在观察智能体遵循其指令时提供实时的二元反馈。我们设计了一种上下文赌博机学习方法,将用户反馈转化为即时奖励。我们通过数千次人机交互进行评估,结果显示指令执行准确率随时间推移绝对提升了 15.4%。我们还表明,我们的方法对多种设计变体具有鲁棒性,并且反馈信号大致相当于监督演示数据的学习信号。
引用
@article{arxiv.2212.09710,
title = {Continual Learning for Instruction Following from Realtime Feedback},
author = {Alane Suhr and Yoav Artzi},
journal= {arXiv preprint arXiv:2212.09710},
year = {2023}
}
备注
NeurIPS 2023 Spotlight paper