低秩最优传输:近似、统计与去偏
机器学习
2022-09-16 v2 机器学习
摘要
最优传输 (OT) 背后的匹配原理在机器学习中扮演着日益重要的角色,这一趋势可见于 OT 被用于消除应用(例如单细胞基因组学)中数据集的歧义,或用于改进更复杂的方法(例如 transformers 中的平衡注意力或自监督学习)。为了扩展到更具挑战性的问题,越来越多的共识认为 OT 需要能够在数百万而非数千个点上运行的求解器。\cite{scetbon2021lowrank} 中所倡导的低秩最优传输 (LOT) 方法在这方面具有若干前景,并已被证明能补充更成熟的熵正则化方法,能够嵌入更复杂的工作流中,例如二次 OT。LOT 将低代价耦合的搜索限制为具有低非负秩的耦合,从而在感兴趣的情形下产生线性时间算法。然而,只有当 LOT 方法在感兴趣的性质上与熵正则化相比被视为合法的竞争者时,这些前景才能实现,其评分标准通常包括理论性质(统计复杂度和与其他方法的关系)或实际方面(去偏、超参数调优、初始化)。我们在本文中针对这些方面逐一研究,以巩固低秩方法在计算 OT 中的影响。
引用
@article{arxiv.2205.12365,
title = {Low-rank Optimal Transport: Approximation, Statistics and Debiasing},
author = {Meyer Scetbon and Marco Cuturi},
journal= {arXiv preprint arXiv:2205.12365},
year = {2022}
}