面向音频到图像生成的跨模态对比表示学习
声音
2022-07-26 v1 计算机视觉与模式识别
图形学
音频与语音处理
摘要
针对特定信息的多种模态提供了该信息的不同视角,可增进对信息的理解。因此,从已有数据生成不同模态的数据以增强理解可能是至关重要的。本文研究了跨模态音频到图像生成问题,并提出跨模态对比表示学习(CMCRL)从音频中提取有用特征并用于生成阶段。实验结果表明,与以往研究相比,CMCRL提升了生成图像的质量。
引用
@article{arxiv.2207.12121,
title = {Cross-Modal Contrastive Representation Learning for Audio-to-Image Generation},
author = {HaeChun Chung and JooYong Shim and Jong-Kook Kim},
journal= {arXiv preprint arXiv:2207.12121},
year = {2022}
}
备注
7 pages, 3 figures, Accepted to MUE 2022