ReTern:利用自然冗余与符号变换增强基于存内计算的三值 LLM 的容错能力
硬件体系结构
2025-06-03 v1
摘要
采用三值精度权重和 8 位激活的三值大型语言模型 (LLM) 展现出了极具竞争力的性能,同时显著降低了全精度 LLM 的高计算和内存需求。通过将三值 LLM 部署在三值存内计算 (TCiM) 加速器上,可以进一步提升其能效和性能,从而缓解冯·诺依曼瓶颈。然而,TCiM 加速器易受内存固定型故障 的影响,导致模型精度下降。由于 LLM 的权重稀疏度低,这一问题对 LLM 尤为严重。为了提高 TCiM 加速器的 SAF 容忍度,我们提出了 ReTern,它基于 故障感知符号变换 (FAST) 和利用自然冗余的 TCiM 位单元重编程。其核心思想是利用 FAST 最小化 +1/-1 权重中由 SAF 引起的计算误差,同时利用自然的位单元冗余来针对 0 权重中的 SAF(零修复)。我们在 BitNet b1.58 700M 和 3B 三值 LLM 上的实验表明,我们的技术提供了显著的容错能力,特别是在存在故障的情况下,Wikitext 数据集上的困惑度降低了 35%。这些收益的代价分别是 < 3%、< 7% 和 < 1% 的能耗、延迟和面积开销。
引用
@article{arxiv.2506.01140,
title = {ReTern: Exploiting Natural Redundancy and Sign Transformations for Enhanced Fault Tolerance in Compute-in-Memory based Ternary LLMs},
author = {Akul Malhotra and Sumeet Kumar Gupta},
journal= {arXiv preprint arXiv:2506.01140},
year = {2025}
}