中文

UniBriVL:音频驱动扩散模型的鲁棒通用表征与生成

声音 2023-09-12 v2 人工智能 音频与语音处理

摘要

多模态大模型因其在各类性能与下游任务中的优势而受认可。这些模型的发展对实现未来通用人工智能至关重要。本文提出一种基于 Bridging-Vision-and-Language(BriVL)的新颖通用语言表征学习方法 UniBriVL。Universal BriVL 将音频、图像与文本嵌入共享空间,从而实现多种多模态应用。我们的方法解决了鲁棒语言(文本与音频)表征学习中的主要挑战,并有效捕捉音频与图像间的相关性。此外,我们展示了 UniBriVL 生成图像的定性评估,以凸显该方法从音频创建图像的潜力。总体而言,实验结果表明 UniBriVL 在下游任务中的有效性及从音频选取恰当图像的能力。所提方法在语音识别、音乐信号处理与字幕系统等应用中具潜力。

关键词

引用

@article{arxiv.2307.15898,
  title  = {UniBriVL: Robust Universal Representation and Generation of Audio Driven Diffusion Models},
  author = {Sen Fang and Bowen Gao and Yangjian Wu and Teik Toe Teoh},
  journal= {arXiv preprint arXiv:2307.15898},
  year   = {2023}
}

备注

Voice-Text fusion input; The first work of audio driven diffusion model. arXiv admin note: text overlap with arXiv:2303.04585