面向自字典可分离非负矩阵分解的内存高效凸优化:一种 Frank-Wolfe 方法
信号处理
2022-07-20 v2 机器学习
摘要
非负矩阵分解(NMF)通常依赖可分离条件以设计易处理的算法。基于可分离性的 NMF 主要由两类方法处理,即贪婪追踪与凸规划。一种著名的凸 NMF 表述是所谓的自字典多测量向量(SD-MMV),它无需先验知道矩阵秩,且相对于贪婪追踪对误差传播更具韧性。然而,凸 SD-MMV 产生了随问题规模二次增长的大量内存开销。这一内存挑战已存在十年,是凸 SD-MMV 应用于大数据分析的主要障碍。本文提出一种面向凸 SD-MMV 的内存高效算法。我们的算法利用了 1950 年代经典算法即 Frank-Wolfe (FW) 算法的特殊更新规则。研究表明,在合理条件下,FW 算法以随数据量线性增长的内存开销求解带噪 SD-MMV 问题。为处理更强噪声场景,提出了一种平滑组稀疏正则化器,在保持低内存占用的同时提升鲁棒性并给出保证。所提方法提出了首个基于凸 SD-MMV 的 NMF 线性内存复杂度算法框架。该方法在文本挖掘与社区发现等若干无监督学习任务上进行了测试,以展示其有效性与内存效率。
引用
@article{arxiv.2109.11135,
title = {Memory-Efficient Convex Optimization for Self-Dictionary Separable Nonnegative Matrix Factorization: A Frank-Wolfe Approach},
author = {Tri Nguyen and Xiao Fu and Ruiyuan Wu},
journal= {arXiv preprint arXiv:2109.11135},
year = {2022}
}