中文

通过对齐梯度更新与内部特征分布实现多模态序列的数据高效对齐

计算机视觉与模式识别 2020-11-17 v1

摘要

视频与文本序列对齐任务是实现电影视频与剧本联合理解的前置步骤。然而,监督方法面临现实训练数据有限的障碍。在本文中,我们试图提升端到端对齐网络NeuMATCH [15]的数据效率。近期研究 [56] 表明,处理不同模态的网络组件可能以不同速度过拟合与泛化,给训练带来困难。我们提议采用(1)层自适应速率缩放(LARS)以对齐不同层中梯度更新的量级并平衡学习节奏,以及(2)序列批量归一化(SBN)以对齐来自不同模态的内部特征分布。最后,我们利用随机投影来降低输入特征的维度。在YouTube Movie Summary数据集上,当省略在LSMDC数据集上的预训练时,这些技术的联合使用弥合了性能差距并取得了最先进(state-of-the-art)的结果。广泛的实证比较与分析表明,这些技术比两种不同设置的层归一化更有效地改善优化并正则化网络。

关键词

引用

@article{arxiv.2011.07517,
  title  = {Data-efficient Alignment of Multimodal Sequences by Aligning Gradient Updates and Internal Feature Distributions},
  author = {Jianan Wang and Boyang Li and Xiangyu Fan and Jing Lin and Yanwei Fu},
  journal= {arXiv preprint arXiv:2011.07517},
  year   = {2020}
}

备注

This paper is accepted to WACV2021