论证据的一般价值及双语场景文本视觉问答
计算机视觉与模式识别
2020-02-27 v2
摘要
视觉问答(VQA)方法取得了令人难以置信的进展,但存在泛化失败的问题。这体现在它们易于学习数据中的偶然相关性,而非图像内容与语言表达思想之间更深层的关联。我们提出一个数据集,在向该问题迈进的一步中,它包含以两种语言表述的问题,以及一个借用公认的基于图像的度量来反映方法推理能力的评估过程。直接度量推理通过对偶然正确的回答进行惩罚来鼓励泛化。该数据集反映了 VQA 问题的场景文本版本,且该推理评估可视为指称表达挑战的基于文本的版本。我们提供了实验和分析以展示该数据集的价值。
引用
@article{arxiv.2002.10215,
title = {On the General Value of Evidence, and Bilingual Scene-Text Visual Question Answering},
author = {Xinyu Wang and Yuliang Liu and Chunhua Shen and Chun Chet Ng and Canjie Luo and Lianwen Jin and Chee Seng Chan and Anton van den Hengel and Liangwei Wang},
journal= {arXiv preprint arXiv:2002.10215},
year = {2020}
}
备注
Accepted to Proc. IEEE Conf. Computer Vision and Pattern Recognition 2020