中文

用于跨模态转换的级联注意力引导残差学习GAN

计算机视觉与模式识别 2021-12-13 v3

摘要

自婴儿时期起,我们便直观地发展出关联来自不同认知传感器(如视觉、音频和文本)输入的能力。然而,在机器学习中,这种跨模态学习是一项非平凡的任务,因为不同模态不具有同质属性。先前的研究发现不同模态之间应存在桥梁。从神经学和心理学角度看,人类具有将一种模态与另一种模态联系起来的能力,例如将鸟的图片与仅听到的鸣叫相关联,反之亦然。机器学习算法是否可能在给定音频信号的情况下恢复场景?本文中,我们提出一种新颖的级联注意力引导残差GAN(Cascade Attention-Guided Residue GAN, CAR-GAN),旨在根据相应的音频信号重建场景。特别地,我们提出一个残差模块以逐步缩小不同模态间的差距。此外,设计了一个具有新颖分类损失函数的级联注意力引导网络来处理跨模态学习任务。我们的模型在高级语义标签域保持一致性,并能够平衡两种不同模态。实验结果表明,我们的模型在具有挑战性的Sub-URMP数据集上实现了 SOTA 的跨模态音视觉生成。代码将发布于 https://github.com/tuffr5/CAR-GAN。

关键词

引用

@article{arxiv.1907.01826,
  title  = {Cascade Attention Guided Residue Learning GAN for Cross-Modal Translation},
  author = {Bin Duan and Wei Wang and Hao Tang and Hugo Latapie and Yan Yan},
  journal= {arXiv preprint arXiv:1907.01826},
  year   = {2021}
}

备注

9 pages, 6 figures, update template