中文

不遗漏任何样本对:基于正则化三元组目标的度量学习改进

机器学习 2022-10-19 v1 人工智能

摘要

我们提出一种三元组目标函数的新形式,可在无额外样本挖掘或开销成本的情况下改进度量学习。我们的方法旨在显式地正则化三元组中正样本与负样本相对于锚点-负样本距离的距离。作为初步验证,我们表明我们的方法(称为不遗漏任何样本对 [NPLB])在标准基准数据集上优于传统及当前最先进的三元组目标公式。为展示 NPLB 在真实世界复杂数据上的有效性与潜力,我们在大规模医疗数据集(UK Biobank)上评估了该方法,证明我们的模型所学嵌入在测试下游任务上显著优于所有其他当前表示。此外,我们提供了一种新的模型无关单次健康风险定义,当与所学表示结合使用时,可最准确地预测受试者未来的健康并发症。我们的结果表明,NPLB 是一种简单而有效的框架,可改进现有深度度量学习模型,展示了度量学习在更复杂应用(尤其是生物与医疗领域)中的潜在意义。

关键词

引用

@article{arxiv.2210.09506,
  title  = {No Pairs Left Behind: Improving Metric Learning with Regularized Triplet Objective},
  author = {A. Ali Heydari and Naghmeh Rezaei and Daniel J. McDuff and Javier L. Prieto},
  journal= {arXiv preprint arXiv:2210.09506},
  year   = {2022}
}

备注

Main manuscript and supplementary material are all as one PDF