中文

DP-Dueling:在不损害用户隐私的前提下从偏好反馈中学习

机器学习 2024-03-25 v1 密码学与安全

摘要

我们研究已被深入探讨的对决赌博机问题,其中学习者在差分隐私约束下,旨在通过成对比较来识别近似最优动作。我们考虑了一类适用于大型(可能无界)决策空间的基于效用的偏好矩阵,并首次提出了用于用户偏好主动学习的差分隐私对决赌博机算法。我们提出的算法计算效率高,且在隐私和非隐私遗憾界方面均具有近似最优性能。更准确地说,我们证明当决策空间大小为有限值 KK 时,我们提出的算法在纯 ϵ\epsilon-DP 下产生阶最优的 O(i=2KlogKTΔi+Kϵ)O\Big(\sum_{i = 2}^K\log\frac{KT}{\Delta_i} + \frac{K}{\epsilon}\Big) 遗憾界,其中 Δi\Delta_i 表示第 ii 个臂的次优性间隙。我们还给出了匹配的下界分析,证明了我们算法的最优性。最后,我们将结果扩展到 dd 维中可能具有无限臂的任意一般决策空间,并设计了一个 ϵ\epsilon-DP 算法,其遗憾为 O~(d6κϵ+dTκ)\tilde{O} \left( \frac{d^6}{\kappa \epsilon } + \frac{ d\sqrt{T }}{\kappa} \right),当 TdT \gg d 时免费提供隐私保护。

关键词

引用

@article{arxiv.2403.15045,
  title  = {DP-Dueling: Learning from Preference Feedback without Compromising User Privacy},
  author = {Aadirupa Saha and Hilal Asi},
  journal= {arXiv preprint arXiv:2403.15045},
  year   = {2024}
}