中文

神经思维语言模型

机器学习 2024-04-18 v2 计算机视觉与模式识别

摘要

思维语言假说认为,人类认知运作于一种结构化的、类似语言的思维表征系统。虽然神经语言模型可以自然地受益于语言数据中固有且明确表达的组成结构,但从非语言的一般观察(如图像)中学习此类表征仍然是一个挑战。在这项工作中,我们引入了神经思维语言模型(NLoTM),这是一种用于无监督学习受LoTH启发的表征和生成的新方法。NLoTM包含两个关键组件:(1) 语义向量量化变分自编码器,它学习与对象及其属性对齐的层次化、可组合的离散表征;(2) 自回归LoT先验,一个自回归Transformer,它学习组合地生成语义概念标记,捕捉底层数据分布。我们在多个2D和3D图像数据集上评估了NLoTM,证明其在下游任务、分布外泛化和图像生成质量方面优于基于块的VQ-VAE和连续以对象为中心的表征。我们的工作通过开发类似LoT的表征,朝着创建展现出更类人理解的神经网络迈出了重要一步,并为认知科学与机器学习的交叉领域提供了见解。

关键词

引用

@article{arxiv.2402.01203,
  title  = {Neural Language of Thought Models},
  author = {Yi-Fu Wu and Minseung Lee and Sungjin Ahn},
  journal= {arXiv preprint arXiv:2402.01203},
  year   = {2024}
}

备注

Accepted in ICLR 2024