基于设计空间探索和编译器优化的RISC-V架构下Tensor Train分解优化
机器学习
2026-02-03 v1 人工智能
硬件体系结构
数学软件
摘要
深度神经网络(DNN)已在诸多实际应用中不可或缺,包括自然语言处理和自动驾驶等领域。然而,在资源受限设备上部署DNN(如RISC-V平台)仍具有挑战性,因为完全连接层(FC层)在资源消耗方面的高计算和内存需求占主导地位。低秩分解(LRF)提供了一种有效的压缩FC层的方法,但LRF解决方案的广泛设计空间在FLOPs、内存大小、推理时间和准确率之间存在复杂的权衡,使得LRF过程复杂且耗时。本文引入一种面向RISC-V处理器的端到端LRF设计空间探索方法和专用设计工具,用于优化FC层。利用TensorFlow T3F库中的Tensor Train分解(TTD),本工作通过排除第一类高效分解形状和第二类在RISC-V架构上推理性能差的解决方案来缩小LRF设计空间。随后应用编译器优化以增强自定义T3F层的性能,最小化推理时间并提升计算效率。在相同的压缩模型上,我们的方法平均比IREE快3倍,比Pluto快8倍。本工作为在由RISC-V架构驱动的边缘和嵌入式设备上部署DNN提供了高效解决方案。
引用
@article{arxiv.2602.01996,
title = {Optimizing Tensor Train Decomposition in DNNs for RISC-V Architectures Using Design Space Exploration and Compiler Optimizations},
author = {Theologos Anthimopoulos and Milad Kokhazadeh and Vasilios Kelefouras and Benjamin Himpel and Georgios Keramidas},
journal= {arXiv preprint arXiv:2602.01996},
year = {2026}
}
备注
36 pages, 16 figures, this is the author-accepted version of the article published in ACM Transactions on Embedded Computing Systems (TECS), Vol. 24, No. 6