通过子句索引提升 Tsetlin 机器的推断与学习速度
机器学习
2020-04-08 v1 人工智能
机器学习
摘要
Tsetlin 机器(TM)是一种基于经典 Tsetlin 自动机(TA)与博弈论的机器学习算法。它进一步利用频繁模式挖掘与资源分配原则来提取数据中的公共模式,而非依赖易于过拟合的最小化输出误差。与神经网络中模式表征的交织性质不同,TM 将问题分解为自包含的模式,以合取子句表示。子句输出进而通过求和与阈值化组合为分类决策,类似于逻辑回归函数,但具有二值权重与单位阶跃输出函数。本文中,我们利用这一层次结构,引入一种避免穷举评估子句的新算法。取而代之的是,我们使用一个简单的查找表,将子句索引到使其为假的特征上。以此方式,我们可通过伪化快速评估大量子句,只需遍历特征并利用查找表排除那些被伪化的子句。该查找表被进一步结构化以方便常数时间更新,从而也支持在学习期间使用。我们在 MNIST 与 Fashion-MNIST 图像分类以及 IMDb 情感分析上报告了高达 15 倍更快的分类与 3 倍更快的学习。
引用
@article{arxiv.2004.03188,
title = {Increasing the Inference and Learning Speed of Tsetlin Machines with Clause Indexing},
author = {Saeed Rahimi Gorji and Ole-Christoffer Granmo and Sondre Glimsdal and Jonathan Edwards and Morten Goodwin},
journal= {arXiv preprint arXiv:2004.03188},
year = {2020}
}
备注
14 pages, 8 figures