通过跨模态梯度协调扩展多模态预训练
计算机视觉与模式识别
2022-11-07 v1 人工智能
机器学习
多媒体
摘要
自监督预训练最近在大规模多模态数据上展现出成功,最先进的对比学习方法通常强制来自跨模态输入(如视频/音频或视频/文本对)的特征一致性。尽管在实践中制定和利用很方便,这种跨模态对齐(CMA)只是一种微弱且含噪的监督,因为即使两个模态在时间上对齐,它们在语义上也可能未对齐。例如,即使在常用的教学视频中,说话者有时也会提及当前帧中未视觉呈现的内容;而对于来自互联网的raw视频,语义未对齐只会更加不可预测。我们推测这可能导致模态间的冲突和偏差,从而可能阻碍CMA扩展到使用更大且更异构的数据进行训练。本文首先通过观察到即使在最新仅使用教学视频的VATT预训练中,同一视频、音频、文本三元组内不同CMA损失之间存在强烈的梯度冲突,验证了我们的推测,表明它们是含噪的监督来源。然后我们提出通过两种技术来协调此类梯度:(i) 跨模态梯度重对齐:为每个样本三元组修改不同的CMA损失梯度,使其梯度方向更加对齐;(ii) 基于梯度的课程学习:利用梯度冲突信息作为样本含噪程度的指标,制定课程学习策略以优先训练含噪较少的样本三元组。将这些技术应用于在HowTo100M数据集上预训练VATT,我们持续提升了其在不同下游任务上的性能。此外,我们能够将VATT预训练扩展到更复杂的非叙事Youtube8M数据集,以进一步改进state-of-the-arts。
引用
@article{arxiv.2211.02077,
title = {Scaling Multimodal Pre-Training via Cross-Modality Gradient Harmonization},
author = {Junru Wu and Yi Liang and Feng Han and Hassan Akbari and Zhangyang Wang and Cong Yu},
journal= {arXiv preprint arXiv:2211.02077},
year = {2022}
}
备注
Accepted at NeurIPS 2022