多图像视觉问答
计算机视觉与模式识别
2022-02-08 v2 人工智能
机器学习
摘要
尽管在开发解决视觉问答问题的模型方面已做了大量工作,但这些模型将问题与图像特征相关联的能力仍较少被探索。我们对不同特征提取方法与不同损失函数进行了实证研究。我们提出了用于多图像输入且仅有一个真实答案的视觉问答任务的新数据集,并在其上对结果进行了基准测试。我们最终的模型利用Resnet + RCNN图像特征和Bert嵌入,受堆叠注意力网络启发,在CLEVER+TinyImagenet数据集上取得了39%的词准确率和99%的图像准确率。
引用
@article{arxiv.2112.13706,
title = {Multi-Image Visual Question Answering},
author = {Harsh Raj and Janhavi Dadhania and Akhilesh Bhardwaj and Prabuchandran KJ},
journal= {arXiv preprint arXiv:2112.13706},
year = {2022}
}