分布鲁棒多输出回归排序
机器学习
2021-09-28 v1
摘要
尽管在经验上取得了成功,但大多数现有的列表级学习排序 (LTR) 模型并非天生就对标注或注释中的错误、分布数据偏移或对抗性数据扰动具有鲁棒性。为了填补这一空白,我们引入了一种新的列表级 LTR 模型,称为分布鲁棒多输出回归排序 (DRMRR)。与现有方法不同,DRMRR 的评分函数被设计为一个从特征向量到偏差分数向量的多元映射,它捕获了局部上下文信息和跨文档交互。DRMRR 使用分布鲁棒优化 (DRO) 框架,在由 Wasserstein 球定义的的经验数据分布邻域内的最不利分布下,最小化多输出损失函数。我们证明这等价于一个带有矩阵范数正则化项的正则化回归问题。我们的实验在两个真实世界应用上进行:医学文档检索和药物反应预测,结果表明 DRMRR 显著优于最先进的 LTR 模型。我们还进行了一项综合分析,以评估 DRMRR 对各种类型噪声的弹性:高斯噪声、对抗性扰动和标签污染。我们表明,DRMRR 不仅能取得显著优于其他基线的性能,而且随着数据中噪声的增加,它能保持相对稳定的性能。
引用
@article{arxiv.2109.12803,
title = {Distributionally Robust Multi-Output Regression Ranking},
author = {Shahabeddin Sotudian and Ruidi Chen and Ioannis Paschalidis},
journal= {arXiv preprint arXiv:2109.12803},
year = {2021}
}