中文

用于量化神经网络映射至混合CMOS-OxRAM基本单元的时间复用存内计算方案

新兴技术 2022-07-29 v2

摘要

本工作中,我们实验演示了实现二值/三值神经网络(BNNs/TNNs)的两个关键基本单元:(i)基于130 nm CMOS的S形神经元,以及(ii)基于HfOx的多级(MLC)OxRAM突触单元。同时给出了一种利用这两个基本单元的优化向量矩阵乘法编程方案。与采用差分突触结构的先前方案相比,本方案每个突触仅用单器件并配合两组读(READ)操作。所提出的硬件映射策略在Fashion MNIST(FMNIST)数据集分类问题上,相较理想量化神经网络(QNN)性能变化小于5%(TNN下降2-5%,BNN上升0.2%),且内存节省达16-32倍。我们还分析了OxRAM器件波动性对硬件QNN(BNN/TNN)性能的影响。

关键词

引用

@article{arxiv.2206.00250,
  title  = {Time-multiplexed In-memory computation scheme for mapping Quantized Neural Networks on hybrid CMOS-OxRAM building blocks},
  author = {Sandeep Kaur Kingra and Vivek Parmar and Manoj Sharma and Manan Suri},
  journal= {arXiv preprint arXiv:2206.00250},
  year   = {2022}
}