中文

通过知识蒸馏处理视觉问答差异预测任务中缺失模态的问题

计算机视觉与模式识别 2021-04-14 v1 计算与语言

摘要

在这项工作中,我们解决了视觉问答差异(Visual Question Answer-Difference)预测任务中出现的缺失模态问题,并找到了一种解决该任务的新方法。我们处理在测试时不可用的缺失模态——即真实答案,并使用一种特权知识蒸馏方案来处理缺失模态问题。为了高效地做到这一点,我们首先引入一个模型“Big” Teacher,它以图像/问题/答案三元组作为输入并优于基线,然后结合多个模型将知识蒸馏到一个仅以图像/问题对作为输入的目标网络(学生)。我们在 VizWiz 和 VQA-V2 Answer Difference 数据集上实验了我们的模型,并通过大量实验和消融研究展示了我们方法的性能以及未来研究的多种可能性。

关键词

引用

@article{arxiv.2104.05965,
  title  = {Dealing with Missing Modalities in the Visual Question Answer-Difference Prediction Task through Knowledge Distillation},
  author = {Jae Won Cho and Dong-Jin Kim and Jinsoo Choi and Yunjae Jung and In So Kweon},
  journal= {arXiv preprint arXiv:2104.05965},
  year   = {2021}
}

备注

To appear in CVPR MULA Workshop