中文

核化离线上下文对决_bandit

机器学习 2023-07-24 v1 人工智能 机器学习

摘要

基于偏好的反馈对于许多无法直接评估奖励函数的应用十分重要。一个值得注意的近期例子出现在大语言模型的人类反馈强化学习中。对于其中许多应用,获取人类反馈的代价可能很高甚至令人望而却步。在本工作中,我们利用智能体通常可以选择获取人类反馈的上下文以最高效地确定良好策略这一事实,引入了离线上下文对决_bandit 设定。我们针对该设定给出了一种上置信界风格算法,并证明了其后悔界。我们还通过实验证实该方法优于使用均匀采样上下文的类似策略。

关键词

引用

@article{arxiv.2307.11288,
  title  = {Kernelized Offline Contextual Dueling Bandits},
  author = {Viraj Mehta and Ojash Neopane and Vikramjeet Das and Sen Lin and Jeff Schneider and Willie Neiswanger},
  journal= {arXiv preprint arXiv:2307.11288},
  year   = {2023}
}