中文

基于稀疏图与测地 Grassmann 流形距离的大数据代表点选择

计算机视觉与模式识别 2015-03-12 v2

摘要

本文解决了从显著更大的海量数据集(即大数据)中识别极小数据点子集的问题。所选的少量数据点必须充分代表并忠实刻画海量大数据。这种识别过程被称为代表点选择 [19]。我们提出了一种新颖的代表点选择框架,通过为给定的大数据集生成一个 l1 范数稀疏图。利用生成的稀疏图上的谱聚类算法,将大数据递归地划分为簇。我们将每个簇视为 Grassmann 流形中的一个点,并测量这些点之间的测地距离。进一步使用 min-max 算法 [1] 分析这些距离,以提取最优的簇子集。最后,通过考虑每个选定簇的稀疏子图,我们利用主成分中心性 [11] 检测代表点。我们将所提出的代表点选择框架称为基于稀疏图和 Grassmann 流形(SGGM)的方法。为了验证所提出的 SGGM 框架,我们将其应用于视频摘要问题,即在更长的视频序列中仅选择少数视频帧(称为关键帧)。将所提算法获得的结果与多位人工评判者达成一致的地面真值以及一些最先进方法进行比较,清楚地表明了 SGGM 框架的可行性。

关键词

引用

@article{arxiv.1405.1681,
  title  = {Representative Selection for Big Data via Sparse Graph and Geodesic Grassmann Manifold Distance},
  author = {Chinh Dang and Hayder Radha},
  journal= {arXiv preprint arXiv:1405.1681},
  year   = {2015}
}

备注

This paper has been withdrawn by the author due to lacking details