中文

何为好的渔夫?自选择偏差下的线性回归

统计理论 2022-12-13 v2 数据结构与算法 机器学习 机器学习 统计理论

摘要

在经典的自选择设定中,目标是从观测(x(i),y(i))(x^{(i)}, y^{(i)})同时学习kk个模型,其中y(i)y^{(i)}kk个底层模型在输入x(i)x^{(i)}上的输出之一。与混合模型(我们观测到随机选定模型的输出)相反,此处观测到的模型取决于输出本身,并由某种已知选择准则决定。例如,我们可能观测到kk个模型的最高输出、最小输出或中位数输出。已知索引自选择中,观测模型输出的身份是可观测的;未知索引自选择中则不可观测。自选择在计量经济学中有悠久历史,并在包括处理效应估计、模仿学习、从策略性报告数据学习以及从非均衡市场学习等各种理论和应用领域中有应用。本工作中,我们针对模型为线性的这一最标准设定,提出了首个计算与统计高效的估计算法。在已知索引情形,我们需要poly(1/ε,k,d)(1/\varepsilon, k, d)样本和时间复杂度以在dd维中将全部模型参数估计至精度ε\varepsilon,并可容纳相当一般的选择准则。在更具挑战性的未知索引情形,即便线性模型的可辨识性(从无限多样本)此前也未知。我们在此情形下针对常被研究的max\max自选择准则给出三个结果:(1)我们证明线性模型确实可辨识,(2)对一般kk我们提供具有poly(d)exp(poly(k))(d) \exp(\text{poly}(k))样本和时间复杂度以将回归参数估计至误差1/poly(k)1/\text{poly}(k)的算法,以及(3)对k=2k = 2我们提供针对任意误差ε\varepsilon且poly(d,1/ε)(d, 1/\varepsilon)样本和时间复杂度的算法。

关键词

引用

@article{arxiv.2205.03246,
  title  = {What Makes A Good Fisherman? Linear Regression under Self-Selection Bias},
  author = {Yeshwanth Cherapanamjeri and Constantinos Daskalakis and Andrew Ilyas and Manolis Zampetakis},
  journal= {arXiv preprint arXiv:2205.03246},
  year   = {2022}
}