中文

DAReN:一种面向推理与解耦的协同方法

机器学习 2022-07-01 v2 计算机视觉与模式识别

摘要

解决视觉推理测试(如瑞文推理矩阵(RPM))的计算学习方法,关键依赖于识别测试中使用的视觉概念(即表示)以及基于这些概念的潜在规则(即推理)的能力。然而,表示与推理的学习是一项具有挑战性且不适定的任务,通常以分阶段的方式(先表示,后推理)来处理。在本工作中,我们提出了一种端到端的联合表示-推理学习框架,其利用一种弱形式的归纳偏置来共同改进两项任务。具体而言,我们引入了针对 RPM 的通用生成图模型 GM-RPM,并将其应用于求解推理测试。我们基于 GM-RPM 的原理,使用一种新颖的学习框架——基于解耦的抽象推理网络(DAReN)来实现这一点。我们在多个基准数据集上对 DAReN 进行了实证评估。DAReN 在推理和解耦任务上均相对于最先进(SOTA)模型表现出一致的改进。这表明解耦的潜在表示与解决抽象视觉推理任务的能力之间存在强相关性。

关键词

引用

@article{arxiv.2109.13156,
  title  = {DAReN: A Collaborative Approach Towards Reasoning And Disentangling},
  author = {Pritish Sahu and Kalliopi Basioti and Vladimir Pavlovic},
  journal= {arXiv preprint arXiv:2109.13156},
  year   = {2022}
}