中文

带乱序标签线性回归的最优估计器

机器学习 2023-10-03 v1 机器学习

摘要

本文考虑带乱序标签的线性回归任务,即 Y=ΠXB+W\mathbf Y = \mathbf \Pi \mathbf X \mathbf B + \mathbf W,其中 YRn×m,PiRn×n,XRn×p,BRp×m\mathbf Y \in \mathbb R^{n\times m}, \mathbf Pi \in \mathbb R^{n\times n}, \mathbf X\in \mathbb R^{n\times p}, \mathbf B \in \mathbb R^{p\times m}WRn×m\mathbf W\in \mathbb R^{n\times m} 分别表示感知结果、(未知或缺失的)对应信息、感知矩阵、感兴趣信号与加性感知噪声。给定观测 Y\mathbf Y 与感知矩阵 X\mathbf X,我们提出一种一步估计器来重构 (Π,B)(\mathbf \Pi, \mathbf B)。从计算角度看,我们估计器的复杂度为 O(n3+np2m)O(n^3 + np^2m),不大于线性分配算法(如 O(n3)O(n^3))与最小二乘算法(如 O(np2m)O(np^2 m))的最大复杂度。从统计角度看,我们将最小 snrsnr 需求划分为四个区间,即未知、困难、中等和容易区间;并给出各区间下正确置换恢复的充分条件:(i)(i) 在容易区间中 snrΩ(1)snr \geq \Omega(1)(ii)(ii) 在中等区间中 snrΩ(logn)snr \geq \Omega(\log n)(iii)(iii) 在困难区间中 snrΩ((logn)c0nc1/srank(B))snr \geq \Omega((\log n)^{c_0}\cdot n^{{c_1}/{srank(\mathbf B)}})c0,c1c_0, c_1 为某些正常数,srank(B)srank(\mathbf B) 表示 B\mathbf B 的稳定秩)。最后,我们亦提供数值实验以证实上述论断。

关键词

引用

@article{arxiv.2310.01326,
  title  = {Optimal Estimator for Linear Regression with Shuffled Labels},
  author = {Hang Zhang and Ping Li},
  journal= {arXiv preprint arXiv:2310.01326},
  year   = {2023}
}