Switch-BERT:通过切换注意力与输入来学习建模多模态交互
计算机视觉与模式识别
2023-06-27 v1 人工智能
摘要
建模模态内与模态间交互的能力是多模态机器学习的基础。当前最先进的模型通常采用具有固定结构的深度学习模型。它们能在特定任务上取得卓越性能,但由于输入模态的多样性及其固定结构,面临着模态失配这一尤为棘手的问题。本文提出 \textbf{Switch-BERT} 用于联合视觉与语言表示学习以解决该问题。Switch-BERT 通过引入可学习的层间与跨层交互扩展了 BERT 架构。它学习从代表这些交互的一组注意力模式集中优化注意力。该模型的一个特定性质是它学习关注不同深度的输出,从而缓解了模态失配问题。我们在视觉问答、图文检索和指代表达理解任务上给出了大量实验。结果证实,尽管包括 ViLBERT 和 UNITER 在内的其他架构可能在某些特定任务上表现出色,Switch-BERT 在这些任务上能持续取得优于或可与当前最先进模型相媲美的性能。消融研究表明,所提模型因其学习任务特定多模态交互的能力而取得更优性能。
引用
@article{arxiv.2306.14182,
title = {Switch-BERT: Learning to Model Multimodal Interactions by Switching Attention and Input},
author = {Qingpei Guo and Kaisheng Yao and Wei Chu},
journal= {arXiv preprint arXiv:2306.14182},
year = {2023}
}
备注
Accepted by ECCV2022