中文

带重尾响应的差分隐私稀疏线性回归

机器学习 2025-06-10 v1 密码学与安全

摘要

作为机器学习和差分隐私 (DP) 中的基本问题,DP 线性回归已受到广泛研究。然而,大多数现有方法主要关注常规数据分布或低维情况下的不规则数据。为克服这些限制,本文系统研究了在高维设置下带重尾响应的 DP 稀疏线性回归。第一部分,我们引入 DP-IHT-H 方法,利用 Huber 损失和私有迭代硬阈值,实现估计误差上界为 O~(s12(logdn)ζ1+ζ+s1+2ζ2+2ζ(log2dnε)ζ1+ζ) \tilde{O}\biggl( s^{* \frac{1 }{2}} \cdot \biggl(\frac{\log d}{n}\biggr)^{\frac{\zeta}{1 + \zeta}} + s^{* \frac{1 + 2\zeta}{2 + 2\zeta}} \cdot \biggl(\frac{\log^2 d}{n \varepsilon}\biggr)^{\frac{\zeta}{1 + \zeta}} \biggr) ,其中 nn 为样本数,dd 为维数,ss^* 为参数稀疏度,ζ(0,1]\zeta \in (0, 1] 描述数据尾部厚度。在第二部分,我们提出 DP-IHT-L 方法,在对响应作出额外假设后进一步改进误差上界,实现 O~((s)3/2logdnε) \tilde{O}\Bigl(\frac{(s^*)^{3/2} \log d}{n \varepsilon}\Bigr) 。与第一个结果相比,该上界独立于尾参数 ζ\zeta。最后,通过在合成数据和真实数据集上的实验,我们展示我们的 метод 在针对“常规”数据的标准 DP 算法方面性能更佳。

关键词

引用

@article{arxiv.2506.06861,
  title  = {Differentially Private Sparse Linear Regression with Heavy-tailed Responses},
  author = {Xizhi Tian and Meng Ding and Touming Tao and Zihang Xiang and Di Wang},
  journal= {arXiv preprint arXiv:2506.06861},
  year   = {2025}
}

备注

Accepted at ECML 2025