中文

测试GLOM从模糊部件推断整体的能力

计算机视觉与模式识别 2022-12-01 v1 机器学习

摘要

Hinton [2021] 提出的 GLOM 架构是一种递归神经网络,用于将图像解析为整体与部件的层级结构。当部件存在模糊性时,GLOM 假设可通过允许该部件对其所属整体的姿态和标识进行多模态预测,随后利用对来自其他可能模糊部件的类似预测的注意力机制,来确定由多个不同部件预测的共同模式,从而解决该模糊性。在本研究中,我们描述了一个高度简化的 GLOM 版本,以评估这种处理模糊性方式的有效性。结果表明,在监督训练下,GLOM 能够成功地为同一对象占据的所有位置形成由极其相似的嵌入向量构成的岛屿,并且对输入中的强噪声注入和分布外输入变换具有鲁棒性。

关键词

引用

@article{arxiv.2211.16564,
  title  = {Testing GLOM's ability to infer wholes from ambiguous parts},
  author = {Laura Culp and Sara Sabour and Geoffrey E. Hinton},
  journal= {arXiv preprint arXiv:2211.16564},
  year   = {2022}
}