用于多模态训练的单分支网络
计算机视觉与模式识别
2023-03-13 v1
摘要
随着社交媒体平台的快速增长,用户正在分享包含音频、图像和文本的数十亿条多媒体帖子。研究者致力于构建能够处理此类多媒体数据的自主系统,以解决跨模态检索、匹配和验证等具有挑战性的多模态任务。现有工作使用独立的网络提取每种模态的嵌入以弥合它们之间的差距。其分支网络的模块化结构在创建众多多模态应用中是基础性的,并已成为处理多种模态的事实标准。相比之下,我们提出了一种新颖的单分支网络,能够在不改变网络的情况下学习单模态以及多模态任务的判别性表示。我们单分支网络的一个重要特征是,它可以使用单一或多种模态进行训练而不牺牲性能。我们在具有挑战性的多模态问题(人脸-声音关联)上,针对采用不同损失形式的跨模态验证与匹配任务评估了所提出的单分支网络。实验结果表明,在广泛的实验中,我们提出的单分支网络优于现有方法。代码:https://github.com/msaadsaeed/SBNet
引用
@article{arxiv.2303.06129,
title = {Single-branch Network for Multimodal Training},
author = {Muhammad Saad Saeed and Shah Nawaz and Muhammad Haris Khan and Muhammad Zaigham Zaheer and Karthik Nandakumar and Muhammad Haroon Yousaf and Arif Mahmood},
journal= {arXiv preprint arXiv:2303.06129},
year = {2023}
}
备注
Accepted at ICASSP 2023