XFlow:用于视听分类的跨模态深度神经网络
机器学习
2023-09-06 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
近年来,为解决多模态任务出现了大量进展,旨在学习比单模态更强的表示。数据的某些方面在此情况下可能特别有用——例如跨模态在空间或时间域上的相关性——但应被明智地利用以从其全部预测潜力中获益。我们提出了两种具有多模态交叉连接的深度学习架构,允许在多个特征提取器之间流动数据(XFlow)。我们的模型比不交换表示的模型导出更具可解释性的特征并取得更好性能,有效利用了音频与视觉数据间的相关性,这些数据维度不同且非平凡可交换。我们的工作在两个方面对现有多模态深度学习算法进行了改进:(1) 提出了一种执行跨模态(在从各模态学习特征之前)的新方法;(2) 扩展了先前提出的交叉连接,其仅在处理兼容数据的流之间传递信息。通过展示连接学习到的一些表示,我们分析它们对判别能力增长的贡献,并揭示它们与唇读网络中间表示的兼容性。我们向研究界提供 Digits,一个由从人们说数字0-9的视频中提取的三种数据类型组成的新数据集。结果表明,在 AVletters、CUAVE 和 Digits 数据集上评估时,两种跨模态架构均优于其基线(最高达11.5%),取得了最先进的结果。
引用
@article{arxiv.1709.00572,
title = {XFlow: Cross-modal Deep Neural Networks for Audiovisual Classification},
author = {Cătălina Cangea and Petar Veličković and Pietro Liò},
journal= {arXiv preprint arXiv:1709.00572},
year = {2023}
}
备注
Accepted at the IEEE ICDL-EPIROB 2017 Workshop on Computational Models for Crossmodal Learning (CMCML), 4 pages, 6 figures