一种基于 Transformer 的对抗训练跨模态融合模型用于 VQA Challenge 2021
计算机视觉与模式识别
2021-10-27 v2 计算与语言
摘要
本文受视觉语言预训练模型的成功以及对抗攻击训练带来益处的启发,提出了一种新颖的基于 transformer 的跨模态融合建模,将这两种思想结合用于 VQA challenge 2021。具体而言,所提模型构建于 VinVL 模型 [19] 的架构之上,并应用对抗训练策略 [4] 以使模型鲁棒且具泛化性。此外,我们的系统中还使用了两种实现技巧以获得更好结果。实验表明,该新框架在 VQAv2 test-std 集上可达到 76.72%。
引用
@article{arxiv.2106.13033,
title = {A Transformer-based Cross-modal Fusion Model with Adversarial Training for VQA Challenge 2021},
author = {Ke-Han Lu and Bo-Han Fang and Kuan-Yu Chen},
journal= {arXiv preprint arXiv:2106.13033},
year = {2021}
}
备注
CVPR 2021 Workshop: Visual Question Answering (VQA) Challenge