将视觉问答视为多任务问题
计算机视觉与模式识别
2020-07-06 v1 人工智能
计算与语言
摘要
视觉问答(VQA)是一组高度复杂的问题,依赖许多子问题来产生合理的答案。在本文中,我们提出视觉问答应被视为一个多任务问题的假设,并提供证据支持该假设。我们通过将两个常用的视觉问答数据集 COCO-QA 和 DAQUAR 重新格式化为多任务格式,并在两个基线网络上训练这些重新格式化的数据集来展示这一点,其中 one 专为排除因重新格式化导致性能变化的其他可能原因而设计。尽管本文所示网络未取得极具竞争力的结果,我们发现视觉问答的多任务方法相比单任务格式带来了 5-9% 的性能提升,且网络比单任务情形更快达到收敛。最后我们讨论了观测到性能差异的可能原因,并进行了额外实验以排除与数据集作为多任务问题学习无关的原因。
引用
@article{arxiv.2007.01780,
title = {Visual Question Answering as a Multi-Task Problem},
author = {Amelia Elizabeth Pollard and Jonathan L. Shapiro},
journal= {arXiv preprint arXiv:2007.01780},
year = {2020}
}