中文

Tsetlin 机嵌入:使用逻辑表达式表示词

计算与语言 2023-01-03 v1 人工智能 机器学习

摘要

将词嵌入向量空间是当前最先进自然语言处理(NLP)的基础性首要步骤。典型的 NLP 方案采用预定义的向量表示,通过在向量空间中使相似词邻近来提升泛化能力。例如,Word2Vec 是一种自监督预测模型,利用神经网络捕捉词的上下文。类似地,GLoVe 是一种流行的无监督模型,融合了语料库级的词共现统计。此类词嵌入显著推动了情感分析、文档分类与机器翻译等重要 NLP 任务。然而,这些嵌入是稠密浮点向量,计算代价高且难以解释。本文中,我们转而提出用少量定义词并通过命题逻辑相关联来表示词的语义。为生成此类逻辑嵌入,我们引入一种基于 Tsetlin 机的自编码器,以自监督方式学习逻辑子句。这些子句由如“black”“cup”“hot”等上下文词构成,用以定义如“coffee”等其他词,从而具备人类可理解性。我们在多项内在与外在基准上评估所提嵌入方法,在六项分类任务上优于 GLoVe。此外,我们利用训练过程中获得的逻辑表示考察了嵌入的可解释性,并在向量空间中可视化词簇,展示我们的逻辑嵌入如何使相似词邻近。

关键词

引用

@article{arxiv.2301.00709,
  title  = {Tsetlin Machine Embedding: Representing Words Using Logical Expressions},
  author = {Bimal Bhattarai and Ole-Christoffer Granmo and Lei Jiao and Rohan Yadav and Jivitesh Sharma},
  journal= {arXiv preprint arXiv:2301.00709},
  year   = {2023}
}

备注

9 pages, 7 figures