SamBaTen:基于采样的批量增量张量分解
机器学习
2024-06-03 v2 人工智能
机器学习
摘要
张量分解是分析多模态数据集的宝贵工具。在许多现实场景中,此类数据集远非静态,相反它们随时间增长。例如,在在线社交网络环境中,随着我们随时间观察到新的交互,我们的数据集在其“时间”模态上更新。我们如何维护这种动态演化的多模态数据集的有效且准确的张量分解,而不必在每次单一更新后重新计算整个分解?本文中,我们介绍SaMbaTen,一种基于采样的批量增量张量分解算法,它在给定张量数据集的新更新时增量地维护分解。由于其能够有效汇总现有张量和传入更新,并在缩减的汇总空间中执行所有计算,SaMbaTen能够扩展到最先进的增量张量分解无法操作的数据集。我们使用合成和真实数据集广泛评估SaMbaTen。示例性地,SaMbaTen达到了与最先进的增量和非增量技术相当的准确性,同时快25-30倍。此外,SaMbaTen可扩展到尺寸高达100K x 100K x 100K的非常大型稀疏和稠密动态演化张量,而最先进的增量方法无法操作。
引用
@article{arxiv.1709.00668,
title = {SamBaTen: Sampling-based Batch Incremental Tensor Decomposition},
author = {Ekta Gujral and Ravdeep Pasricha and Evangelos E. Papalexakis},
journal= {arXiv preprint arXiv:1709.00668},
year = {2024}
}