中文

MANOJAVAM:面向矩阵乘法和奇点分解主成分分析的可扩展统一 FPGA 加速器

硬件体系结构 2026-05-05 v1 分布式、并行与集群计算

摘要

主成分分析 (PCA) 在高光谱成像、基因组学和神经科学中广泛用于降维。然而,其在矩阵乘法和奇点分解 (SVD) 上的计算瓶颈制约了其应用。现有 PCA 硬件加速器要么仅针对这两个阶段之一进行优化,要么依赖高级综合 (HLS) 导致微架构优化受限,要么使用定点数据路径,限制了数据集的可扩展性。因此,本文提出的 MANOJAVAM 是一个面向任意输入维度的统一 PCA 加速器架构。MANOJAVAM(T,S) 由 S 个 T×T TPU 风格的 systolic 数组组成,采用块流式传输实现高吞吐矩阵乘法。它进一步集成了高度并行的 Jacobian 单元,实现 Jacobi 方法进行 SVD,采用流水线化的 CORDIC 旋转。双层缓存层次和模式感知内存策略适应协方差矩阵和旋转计算的不同内存访问模式。为演示目的,MANOJAVAM(4,8) 在 Xilinx Artix-7 FPGA 上实现,频率为 200 MHz,功耗为 1.271 W。MANOJAVAM(16,32) 在 Xilinx Virtex-Ultrascale+ FPGA 上实现,频率为 434 MHz,功耗为 16.957 W。在真实数据集上进行基准测试显示,MANOJAVAM(16,32) 在 SVD 延迟上实现了最高 22.75 倍加速,在总能耗上实现了 42.14 倍降低,相较于高性能 NVIDIA A6000 GPU。该架构提供了一个面向大规模数据分析的统一、可扩展且高效的平台,适用于高性能和边缘计算环境。

关键词

引用

@article{arxiv.2605.01514,
  title  = {MANOJAVAM: A Scalable, Unified FPGA Accelerator for Matrix Multiplication and Singular Value Decomposition in Principal Component Analysis},
  author = {Srivaths Ramasubramanian and Anjali Devarajan and Kousthub P Kaivar and Vibha Shrestta and Shashank D and Sowmyarani C. N and Govinda Raju M and K. S Geetha},
  journal= {arXiv preprint arXiv:2605.01514},
  year   = {2026}
}