中文

超越岭回归:面向无分布数据

机器学习 2022-06-20 v1

摘要

在有监督批量学习中,预测归一化极大似然(pNML)被提出作为无分布设定下的极小极大后悔解,该设定对数据不作任何分布假设。然而,对于过参数化线性回归这样的大容量假设类,pNML 并未定义。对于大类,常见方法是使用正则化或模型先验。在极小极大解为归一化极大似然(NML)的在线预测背景下,已有建议将带“幸运度”的 NML 用于:对假设类施加类先验函数,以缩减其有效规模。受幸运度概念启发,对于线性回归,我们引入一个按 l2 范数比例惩罚假设的幸运度函数。这导出了岭回归解。相关的带幸运度 pNML(LpNML)预测偏离岭回归经验风险最小化器(Ridge ERM):当测试数据位于对应训练数据经验相关矩阵小特征值的子空间时,预测向 0 偏移。我们的 LpNML 在 PMLB 数据集上将 Ridge ERM 误差降低多达 20%,且相较于近期 UCI 数据集的领先方法,在分布偏移存在时鲁棒性高出多达 4.9%。

关键词

引用

@article{arxiv.2206.08757,
  title  = {Beyond Ridge Regression for Distribution-Free Data},
  author = {Koby Bibas and Meir Feder},
  journal= {arXiv preprint arXiv:2206.08757},
  year   = {2022}
}