中文

Gold Seeker:来自策略分布的信息增益用于目标导向的视觉与语言推理

机器学习 2020-03-31 v3 机器学习

摘要

随着计算机视觉从对像素的被动分析转向对语义的主动分析,算法需要推理的信息广度已显著扩展。此方向上的一个关键挑战是能够识别做决策所需的信息,并选择能获取该信息的动作。我们提出一种强化学习方法,该方法在其内部信息上维持一个分布,从而显式表示其已知和需知内容以实现目标的不确定性。然后根据该分布生成潜在动作。对每个潜在动作计算期望结果的一个分布,并评估潜在信息增益的价值。所采取的动作为使潜在信息增益最大化的那个。我们展示了该方法应用于两个近期引起显著兴趣的视觉与语言问题:视觉对话和视觉查询生成。在这两种情况下,该方法主动选择能最佳降低其内部不确定性的动作,并在实现挑战目标上优于其竞争者。

关键词

引用

@article{arxiv.1812.06398,
  title  = {Gold Seeker: Information Gain from Policy Distributions for Goal-oriented Vision-and-Langauge Reasoning},
  author = {Ehsan Abbasnejad and Iman Abbasnejad and Qi Wu and Javen Shi and Anton van den Hengel},
  journal= {arXiv preprint arXiv:1812.06398},
  year   = {2020}
}