中文

降维与(桶)排序:一种质量传输方法

机器学习 2019-09-02 v2 机器学习

摘要

尽管大多数用于多变量数据的降维技术(如 PCA、ICA、NMF)在某种程度上基本依赖于线性代数,但由于置换集 Sn\mathfrak{S}_n 缺乏向量空间结构,将排序数据(视为索引为 i{1,,  n}i\in \{1,\ldots,\; n\} 的物品集上随机置换 Σ\Sigma 的实现)进行概括是一项巨大的统计挑战。本文的目标是开发一个原创框架,以可能减少描述由排序/置换组成的统计总体分布所需的参数数量,其前提是所研究物品集可被划分为子集/桶,使得以高概率某个桶中的物品要么全部排在另一桶中物品之前,要么全部排在其之后。在此背景下,Σ\Sigma 的分布可望以稀疏方式由桶分布表示,即桶排序加上各桶内的排序分布。更精确地,我们引入一种基于质量传输度量的专用失真测度,以量化此类表示的准确性。通过速率界分析研究了使失真经验版本最小的桶的性能。还考虑了复杂度惩罚技术,以选择具有最小期望失真的桶序形状。除理论概念与结果外,还展示了真实排序数据上的数值实验,以提供该方法相关性的经验证据。

关键词

引用

@article{arxiv.1810.06291,
  title  = {Dimensionality Reduction and (Bucket) Ranking: a Mass Transportation Approach},
  author = {Mastane Achab and Anna Korba and Stephan Clémençon},
  journal= {arXiv preprint arXiv:1810.06291},
  year   = {2019}
}