中文

方向性 Rockafellar-Uryasev 回归

机器学习 2024-11-06 v1 机器学习

摘要

大多数大型数据集都受到选择偏差的影响。例如,X(Twitter)的训练观测与测试离线观测存在显著差异,因为 Twitter 上的个体通常受教育程度更高、更倾向民主或左翼。因此,可靠估计的一个主要障碍是训练数据和测试数据之间的差异。研究人员如何在存在不可忽略的选择机制的情况下利用此类数据?已为此问题开发了多种方法,如分布鲁棒优化(DRO)或学习公平性。减少偏差影响的一个可能途径是元信息。研究人员作为领域专家,可能拥有关于选择偏差的形式和程度以及选择可能导致估计值变化方向(例如高估或低估)的先验信息。同时,没有直接利用此类信息的方法。我提出了一种损失函数,它考虑了研究人员提供的两种元数据信息:偏差的量和方向(欠采样或过采样)。通过神经网络实现带有所提出损失函数的估计,即方向性 Rockafellar-Uryasev(dRU)回归模型。我在一个有偏训练数据集——大型在线选举民意调查——上测试了 dRU 模型。我使用与先前研究中获得的一致的政治和采样信息的元数据来应用所提出的模型。结果表明,包含元信息改善了选举结果预测,优于不包含元信息的模型。

关键词

引用

@article{arxiv.2411.02557,
  title  = {A Directional Rockafellar-Uryasev Regression},
  author = {Alberto Arletti},
  journal= {arXiv preprint arXiv:2411.02557},
  year   = {2024}
}

备注

8 figures, 19 pages, 5 tables