中文

从不完美的人类反馈学习:不完全 duel 中的 corruption-robust 学习之旅

机器学习 2024-10-16 v2 机器学习

摘要

本文研究学习不完美的人类反馈(LIHF)问题,探讨当人类反应不理性或感知不佳时的学习方法。基于人类随时间衰减不完美性的证据(即人类会学习改进),我们将此问题建模为受限形式的不完全 duel 连续动作多臂赌博机问题:即不完美程度随时间以 tρ1t^{\rho-1} 的速度衰减,其中 ρ[0,1]\rho \in [0, 1] 为"不完美率"。在总迭代次数为 TT 的情况下,我们为 LIHF 建立 Ω(max{T,Tρ})\Omega(\max\{\sqrt{T}, T^{\rho}\}) 的 regrets下界,即使 ρ\rho 已知亦然。对于相同设置,我们发展了针对不完美 duel 的稳健随机镜像梯度下降算法(RoSMID),实现近乎最优的 regrets O~(max{T,Tρ})\tilde{\mathcal{O}}(\max\{\sqrt{T}, T^{\rho}\})。我们方法的核心是一种新框架,用于分析在不完全 duel 情况下,对基于梯度的算法进行分析,并通过将该框架轻易应用于其他流行的基于梯度的 duel 多臂赌博机算法,从而获得抗 corruption保证。我们的理论结果通过大量实验得到验证。

关键词

引用

@article{arxiv.2405.11204,
  title  = {Learning from Imperfect Human Feedback: a Tale from Corruption-Robust Dueling},
  author = {Yuwei Cheng and Fan Yao and Xuefeng Liu and Haifeng Xu},
  journal= {arXiv preprint arXiv:2405.11204},
  year   = {2024}
}