在线性_bandit中交互式学习偏好约束
机器学习
2022-06-13 v1 人工智能
机器学习
摘要
我们研究具有已知奖励和未知约束的序贯决策问题,其动机来源于约束代表昂贵评估的人类偏好(例如安全且舒适的驾驶行为)的情形。我们将交互式学习这些约束的挑战形式化为一种新颖的线性 bandit 问题,称之为约束线性最优臂辨识。为解决该问题,我们提出了自适应约束学习(ACOL)算法。我们给出了约束线性最优臂辨识的实例相关下界,并表明 ACOL 的样本复杂度在最坏情况下与该下界匹配。在平均情况下,ACOL 的样本复杂度界仍显著紧于更简单方法的界。在合成实验中,ACOL 表现与 oracle 解相当,并优于一系列基线。作为一个应用,我们考虑在驾驶仿真中学习代表人类偏好的约束。ACOL 在该应用上比替代方案显著更具样本效率。此外,我们发现将偏好作为约束学习比直接将偏好编码于奖励函数中对驾驶场景变化更具鲁棒性。
引用
@article{arxiv.2206.05255,
title = {Interactively Learning Preference Constraints in Linear Bandits},
author = {David Lindner and Sebastian Tschiatschek and Katja Hofmann and Andreas Krause},
journal= {arXiv preprint arXiv:2206.05255},
year = {2022}
}
备注
Accepted to International Conference on Machine Learning (ICML), 2022