无需问答训练的可视化问答
计算机视觉与模式识别
2020-05-27 v2
摘要
近年来,教机器回答视觉问题的方法取得了显著进展,但现有方法仍缺乏重要的人类能力,包括以模块化方式整合新的视觉类别与概念、提供答案解释以及在没有显式样例的情况下处理新领域。我们提出了一种由两部分组成的新方法:生成问题图表示,以及由问题图抽象结构引导以调用一组可扩展视觉估计器的回答过程。语言部分与视觉部分各自独立训练,但与现有方案不同,该方法不需要任何使用带关联问题与答案的图像进行的训练。只要相应的视觉估计器可用,该方法就能处理新领域(扩展的问题类型以及新的对象类别、属性与关系)。此外,它可对其答案提供解释,并在问题未基于图像时给出替代建议。我们证明该方法在任何问答训练下均实现了高性能与领域可扩展性。
引用
@article{arxiv.1811.08481,
title = {VQA with no questions-answers training},
author = {Ben-Zion Vatashsky and Shimon Ullman},
journal= {arXiv preprint arXiv:1811.08481},
year = {2020}
}
备注
Accepted to CVPR 2020