从不完美的人类反馈学习:不完全 duel 中的 corruption-robust 学习之旅
机器学习
2024-10-16 v2 机器学习
摘要
本文研究学习不完美的人类反馈(LIHF)问题,探讨当人类反应不理性或感知不佳时的学习方法。基于人类随时间衰减不完美性的证据(即人类会学习改进),我们将此问题建模为受限形式的不完全 duel 连续动作多臂赌博机问题:即不完美程度随时间以 的速度衰减,其中 为"不完美率"。在总迭代次数为 的情况下,我们为 LIHF 建立 的 regrets下界,即使 已知亦然。对于相同设置,我们发展了针对不完美 duel 的稳健随机镜像梯度下降算法(RoSMID),实现近乎最优的 regrets 。我们方法的核心是一种新框架,用于分析在不完全 duel 情况下,对基于梯度的算法进行分析,并通过将该框架轻易应用于其他流行的基于梯度的 duel 多臂赌博机算法,从而获得抗 corruption保证。我们的理论结果通过大量实验得到验证。
引用
@article{arxiv.2405.11204,
title = {Learning from Imperfect Human Feedback: a Tale from Corruption-Robust Dueling},
author = {Yuwei Cheng and Fan Yao and Xuefeng Liu and Haifeng Xu},
journal= {arXiv preprint arXiv:2405.11204},
year = {2024}
}