中文

不可实现设定下线性混合回归的学习

机器学习 2022-05-27 v1 信息论 机器学习 math.IT

摘要

尽管线性混合回归(MLR)是一个被充分研究的课题,先前工作通常未从预测误差角度分析此类模型。事实上,在混合模型的语境中,预测与损失并未被良好定义。本文中,我们首先表明 MLR 可用于预测:模型不预测单个标签,而是预测一组值(亦称列表解码)。列表大小等于混合中的分量数,损失函数定义为所有分量模型所产生损失中的最小值。我们表明在此定义下,经验风险最小化(ERM)的解能达到较小的预测误差概率。这亟需一种最小化 MLR 经验风险的算法,而该问题已知在计算上困难。MLR 的已有算法工作聚焦于可现实设定,即数据由混合线性(含噪)模型以概率方式生成时的参数恢复。本文中我们表明,在数据集与初始点的一些正则条件下,流行版本的轮换最小化(AM)算法即使在不假设可现实模型时也能在数据集中找到最佳拟合直线,从而给出 ERM 的一个解。我们进一步提供一种在数据点数量上多项式时间运行的算法,恢复最佳拟合直线的良好近似。我们对两种算法进行了实验比较。

关键词

引用

@article{arxiv.2205.13166,
  title  = {On Learning Mixture of Linear Regressions in the Non-Realizable Setting},
  author = {Avishek Ghosh and Arya Mazumdar and Soumyabrata Pal and Rajat Sen},
  journal= {arXiv preprint arXiv:2205.13166},
  year   = {2022}
}

备注

To appear in ICML 2022