基于事后指令反馈的可证明交互式学习
机器学习
2024-04-16 v1 人工智能
计算与语言
机器学习
摘要
我们研究了一种交互式学习设定,其中智能体需要根据给定的上下文和指令生成一个响应(例如,一个动作或轨迹)。与使用奖励或专家对响应进行监督来训练系统的典型方法不同,我们研究的是基于事后指令的学习,即教师提供一个最适合智能体所生成响应的指令。这种对指令的事后标注通常比提供最优响应的专家监督更容易,因为后者可能需要专家知识或难以获取。我们启动了对基于事后标注的交互式学习的理论分析。我们首先给出了一个下界,表明在一般情况下,任何算法的遗憾值都必须与智能体响应空间的大小成比例。然后,我们研究了一个特殊的设定,其中底层的指令-响应分布可以分解为一个低秩矩阵。我们为此设定引入了一种名为LORIL的算法,并证明其遗憾值按√T缩放,其中T是轮次数,且依赖于内在秩,但不依赖于智能体响应空间的大小。我们在两个领域提供了实验,表明即使低秩假设被违反,LORIL也优于基线方法。
引用
@article{arxiv.2404.09123,
title = {Provable Interactive Learning with Hindsight Instruction Feedback},
author = {Dipendra Misra and Aldo Pacchiano and Robert E. Schapire},
journal= {arXiv preprint arXiv:2404.09123},
year = {2024}
}