中文

面向音频到图像生成的跨模态对比表示学习

声音 2022-07-26 v1 计算机视觉与模式识别 图形学 音频与语音处理

摘要

针对特定信息的多种模态提供了该信息的不同视角,可增进对信息的理解。因此,从已有数据生成不同模态的数据以增强理解可能是至关重要的。本文研究了跨模态音频到图像生成问题,并提出跨模态对比表示学习(CMCRL)从音频中提取有用特征并用于生成阶段。实验结果表明,与以往研究相比,CMCRL提升了生成图像的质量。

关键词

引用

@article{arxiv.2207.12121,
  title  = {Cross-Modal Contrastive Representation Learning for Audio-to-Image Generation},
  author = {HaeChun Chung and JooYong Shim and Jong-Kook Kim},
  journal= {arXiv preprint arXiv:2207.12121},
  year   = {2022}
}

备注

7 pages, 3 figures, Accepted to MUE 2022