具有定性反馈的决斗_bandit问题
机器学习
2018-09-19 v2 机器学习
摘要
我们提出并研究一种称为定性决斗_bandit(QDB)问题的新型多臂_bandit问题,其中智能体通过拉动每根臂观察到的是定性而非数值反馈。我们采用与决斗_bandit(DB)问题相同的后悔值,其中决斗通过比较定性反馈来进行。尽管我们可以朴素地使用经典 DB 算法求解 QDB 问题,但这种归约会显著恶化性能——实际上,在 QDB 问题中,一根臂在决斗中战胜另一根臂的概率无需进行实际决斗即可直接估计。本文中,我们针对 QDB 问题提出此类直接算法。我们的理论分析表明,所提算法通过纳入定性反馈显著优于 DB 算法,实验结果也展示了相较现有 DB 算法的巨大改进。
引用
@article{arxiv.1809.05274,
title = {Dueling Bandits with Qualitative Feedback},
author = {Liyuan Xu and Junya Honda and Masashi Sugiyama},
journal= {arXiv preprint arXiv:1809.05274},
year = {2018}
}