中文

COGNATE:使用迁移学习加速新兴硬件上的稀疏张量程序

机器学习 2025-06-17 v2 人工智能 硬件体系结构 新兴技术

摘要

稀疏张量程序在深度学习和图分析中至关重要,推动了对优化处理的需求。为满足这一需求,专用的硬件加速器正在开发中。为加速器优化这些程序面临两大挑战:程序性能对稀疏输入的变化高度敏感,且早期阶段的加速器依赖昂贵的模拟器。因此,用于在通用硬件上优化此类程序的基于机器学习的成本模型通常对早期阶段的加速器无效,因为它们需要大量数据集才能进行适当训练。为此,我们引入了 COGNATE,这是一种新颖的框架,它利用来自通用硬件(如 CPU)的廉价数据样本来训练成本模型,随后在新兴硬件上进行少样本微调。COGNATE 利用了跨硬件平台输入特征的同质性,同时有效缓解了异构性,仅需特定加速器模型所需数据样本的 5% 即可实现相当的性能。我们进行了大量实验,证明 COGNATE 优于现有技术,在 SpMM 上实现了 1.47 倍(最高 5.46 倍)的平均加速,在 SDDMM 上实现了 1.39 倍(最高 4.22 倍)的平均加速。

关键词

引用

@article{arxiv.2506.00424,
  title  = {COGNATE: Acceleration of Sparse Tensor Programs on Emerging Hardware using Transfer Learning},
  author = {Chamika Sudusinghe and Gerasimos Gerogiannis and Damitha Lenadora and Charles Block and Josep Torrellas and Charith Mendis},
  journal= {arXiv preprint arXiv:2506.00424},
  year   = {2025}
}

备注

Accepted at the 42nd International Conference on Machine Learning