FastOmniTMAE:面向可扩展与硬件高效的 Tsetlin 嵌入的并行子句学习
机器学习
2026-05-11 v1
摘要
自然语言处理(NLP)中的嵌入模型日益依赖诸如 BERT 的深度架构,而诸如 Word2Vec 等较简单的模型虽能提供高效的表示,但可解释性有限。Tsetlin Machine(TM)提供了一种替代的基于逻辑的学习范式。Omni TM Autoencoder(Omni TM-AE)通过利用单个子句层内的自动机状态分布,将该范式应用于静态嵌入,但其训练过程仍然缓慢。在这项工作中,我们提出了 FastOmniTMAE,这是对 Omni TM-AE 的一种重新表述,它用评估和更新两阶段并行过程取代了序列训练依赖。使用涵盖分类、相似性和聚类的单次运行多环境基准测试,FastOmniTMAE 在分类任务中实现了高达 5 的训练加速,同时在 Spearman 和 Kendall 相似性度量下保持了相当的嵌入质量。为了解决 TM 训练在传统 GPU 上效率有限的问题,我们进一步在 SoC-FPGA 平台上将 FastOmniTMAE 实现为可重用的加速器。多硬件基准测试表明,FastOmniTMAE 在资源受限的 FPGA 上达到了 0.669 的相似性得分,在 UltraScale+ SoC 上达到了 0.696,证明了其能在硬件占用面积小的情况下实现高效的基于逻辑的嵌入训练。
引用
@article{arxiv.2605.06982,
title = {FastOmniTMAE: Parallel Clause Learning for Scalable and Hardware-Efficient Tsetlin Embeddings},
author = {Ahmed K. Kadhim and Lei Jiao and Rishad Shafik and Ole-Christoffer Granmo and Mayur Kishor Shende},
journal= {arXiv preprint arXiv:2605.06982},
year = {2026}
}