若无破损,勿须修理:稀疏度量修复
机器学习
2017-10-31 v1 数据结构与算法
摘要
许多现代数据密集型计算问题要么要求、要么受益于遵循度量的距离或相似性数据。算法运行更快或具有更好的性能保证。不幸的是,在真实应用中,数据是杂乱的且取值含噪。数据点之间的距离远不满足度量。确实,已有若干不同算法用于寻找与给定值最接近且同时满足度量(有时附带为欧几里得度量的额外条件)的距离集合。这些算法可能产生非预期后果,它们可能改变大量原始数据点,并改变数据的许多其他特征。稀疏度量修复的目标是对原始数据集或底层距离做尽可能少的改动,以确保所得距离满足度量的性质。换言之,我们寻求在所得距离满足度量的约束下,最小化对距离所做改动的稀疏性(或 “范数”)。我们给出三种不同的组合算法来稀疏地修复度量。在一种设定下,算法保证返回最稀疏解;在其他设定下,算法修复度量。若无先验信息,算法运行时间与输入数据点数的立方成正比;若有先验信息,我们可大幅降低运行时间。
引用
@article{arxiv.1710.10655,
title = {If it ain't broke, don't fix it: Sparse metric repair},
author = {Anna C. Gilbert and Lalit Jain},
journal= {arXiv preprint arXiv:1710.10655},
year = {2017}
}