利用焦点图对视觉问答模型进行基准测试
计算机视觉与模式识别
2018-01-17 v1
摘要
Inferring and Executing Programs for Visual Reasoning 提出了一种用于视觉推理的模型,由程序生成器和执行引擎组成,以避免端到端模型。为表明该模型确实学习了应关注哪些对象来回答问题,作者给出了预测答案分数之和相对于最终特征图的梯度的范数可视化。然而,作者并未评估焦点图的效率。本文提出了一种评估它的方法。我们生成若干类问题以测试不同关键词。我们通过提出这些问题从模型中推断焦点图,并通过与分割图比较来评估它们。此外,只要能从模型中推断焦点图,该方法可应用于任何模型。通过在 CLEVR 数据集上评估不同模型的焦点图,我们将展示 CLEVR-iep 模型比端到端模型更多地学习了应关注的位置。
引用
@article{arxiv.1801.05302,
title = {Benchmark Visual Question Answer Models by using Focus Map},
author = {Wenda Qiu and Yueyang Xianzang and Zhekai Zhang},
journal= {arXiv preprint arXiv:1801.05302},
year = {2018}
}
备注
A group project paper for course CS348. arXiv admin note: text overlap with arXiv:1705.03633 by other authors