中文

面向低复杂度机器学习时域种群计数的高效 FPGA 实现

机器学习 2025-05-06 v1 硬件体系结构

摘要

种群计数(popcount)是许多低复杂度机器学习(ML)算法中的一项关键操作,包括 Tsetlin 机(TM)——一种前景广阔的新型 ML 方法,尤其适合解决分类任务。TM 中的推理机制由每个类别内基于命题逻辑的结构组成,随后通过多数投票方案做出分类决策。在 TM 中,投票者是布尔子句的输出。投票机制包含两个操作:对每个类别进行种群计数,以及通过 argmax 操作确定得票最多的类别。虽然 TM 提供了一种轻量级的 ML 替代方案,但其性能常受限于产生 argmax 结果所需的种群计数和比较操作的高计算成本。在本文中,我们提出了一种通过在时域中执行这些操作来加速和优化它们的创新方法。我们的时域实现使用可编程延迟线(PDL)和仲裁器,通过基于延迟的机制高效地管理这些任务。我们还提出了一个用于实际实现时域种群计数的 FPGA 设计流程,解决了延迟偏差问题,并确保其行为与模型预期功能相匹配。通过利用所提出的种群计数与异步架构的自然兼容性,我们展示了在异步 TM 中的显著改进,与使用基于加法器的种群计数的同步 TM 相比,延迟最多降低 38%,动态功耗降低 43.1%,资源利用率节省 15%。

关键词

引用

@article{arxiv.2505.02181,
  title  = {Efficient FPGA Implementation of Time-Domain Popcount for Low-Complexity Machine Learning},
  author = {Shengyu Duan and Marcos L. L. Sartori and Rishad Shafik and Alex Yakovlev and Emre Ozer},
  journal= {arXiv preprint arXiv:2505.02181},
  year   = {2025}
}