中文

CLEVR-Ref+:用指称表达式诊断视觉推理

计算机视觉与模式识别 2019-04-09 v2 计算与语言 机器学习

摘要

指称目标检测与指称图像分割是要求联合理解视觉信息与自然语言的重要任务。然而有证据表明,当前基准数据集存在偏差,且当前最先进模型其中间推理过程难以被评估。为解决这些问题并补充视觉问答中的类似努力,我们构建了 CLEVR-Ref+,一个用于指称表达式理解的合成诊断数据集。物体的精确位置与属性易于获取,且指称表达式自动与函数式程序相关联。合成特性允许通过采样策略控制数据集偏差,而模块化程序无需人工标注即可提供中间推理真值。除了在 CLEVR-Ref+ 上评估若干最先进模型外,我们还提出 IEP-Ref,一种模块化网络方法,在我们的数据集上显著优于其他模型。特别地,我们使用 IEP-Ref 给出了两个有趣且重要的发现:(1)训练用于将特征图转换为分割掩码的模可附加于任意中间模以逐步揭示整个推理过程;(2)即使所有训练数据至少指称一个物体,IEP-Ref 在面对错误前提指称表达式时仍能正确预测无前景。据我们所知,这是神经网络模块按其预期方式运作的首个直接且定量的证明。

关键词

引用

@article{arxiv.1901.00850,
  title  = {CLEVR-Ref+: Diagnosing Visual Reasoning with Referring Expressions},
  author = {Runtao Liu and Chenxi Liu and Yutong Bai and Alan Yuille},
  journal= {arXiv preprint arXiv:1901.00850},
  year   = {2019}
}

备注

To appear in CVPR 2019. All data and code concerning CLEVR-Ref+ and IEP-Ref have been released at https://cs.jhu.edu/~cxliu/2019/clevr-ref+