SafeCiM:探讨混合浮点计算-存储深度学习加速器的韧性
硬件体系结构
2025-12-02 v1 机器学习
摘要
深度神经网络 (DNN) 的复杂度持续增长,大型语言模型 (LLM) 采纳了海量参数。在传统加速器中高效处理这些参数受数据传输瓶颈限制,激发了计算-存储 (Compute-in-Memory, CiM) 架构的发展,这类架构将计算集成在存储器内部或附近,以减少数据传输。近期研究探索了基于浮点 (FP) 和整数 (INT) 操作的 CiM 设计。FP 计算因其更宽的动态范围和精度,通常能提供更高的输出质量,这对于精度敏感的生成式 AI 应用至关重要,包括 LLM 等模型,推动了 FP-CiM 加速器的发展。然而,FP-CiM 面临硬件故障的脆弱性仍未得到充分探索,这在关键任务场景中构成了重大的可靠性挑战。为填补这一空白,本文系统性地分析了 FP-CiM 中硬件故障的影响,通过在关键计算阶段引入位翻转故障,包括数字乘法器、CiM 存储单元以及数字加法树。针对卷积神经网络 (CNN) 如 AlexNet 以及最先进的 LLM 包括 LLaMA-3.2-1B 和 Qwen-0.3B-Base 进行实验,揭示了各阶段故障对推理准确率的影响。值得注意的是,单个加法器故障即可使 LLM 准确率降至 0%。基于这些洞察,我们提出了一种容错设计 SafeCiM,显著优于采用预对齐阶段的朴素 FP-CiM。例如,对于 4096 个 MAC 单元的 SafeCiM,在单一加法器故障情况下,准确率退化降低了最高可达 49 倍。
引用
@article{arxiv.2512.00059,
title = {SafeCiM: Investigating Resilience of Hybrid Floating-Point Compute-in-Memory Deep Learning Accelerators},
author = {Swastik Bhattacharya and Sanjay Das and Anand Menon and Shamik Kundu and Arnab Raha and Kanad Basu},
journal= {arXiv preprint arXiv:2512.00059},
year = {2025}
}