中文

基于随机索引的张量增量式降维

数据结构与算法 2017-03-16 v1 计算与语言 信息检索

摘要

我们提出了一种基于稀疏随机线性编码的增量式、可扩展且高效的张量降维技术。数据以固定大小的压缩表示形式存储,这使得内存需求低且可预测。组件编码和解码在线进行,无需对数据集进行昂贵的重新分析。张量索引的范围可以动态扩展,而无需修改组件表示。这一想法源于语义记忆的数学模型和自然语言处理中称为随机索引的方法。我们将随机索引算法推广到张量,并给出了向量和矩阵表示的信噪比模拟。我们还对高维三元向量的近似正交性进行了数学分析,这是支撑此方法和其他类似随机编码降维方法的一个性质。为了进一步展示随机索引的性质,我们给出了同义词识别任务的结果。这里提出的方法与随机投影和Tucker分解有一些相似之处,但它仅在高维(n>10^3)下表现良好。随机索引适用于一系列复杂的实际问题,例如自然语言处理、数据挖掘、模式识别、事件检测、图搜索和搜索引擎。提供了原型软件。它支持在一个统一框架内对阶数>=1的张量进行编码和解码,即向量、矩阵和高阶张量。

关键词

引用

@article{arxiv.1103.3585,
  title  = {Incremental dimension reduction of tensors with random index},
  author = {Fredrik Sandin and Blerim Emruli and Magnus Sahlgren},
  journal= {arXiv preprint arXiv:1103.3585},
  year   = {2017}
}

备注

36 pages, 9 figures