基于BriVL的高效调优音频表征学习方法探索
声音
2023-08-08 v2 人工智能
音频与语音处理
摘要
近来,研究者逐渐认识到,在某些情况下,大规模互联网数据上的自监督预训练优于高质量/人工标注数据集,且多模态/大模型优于单模态或双模态/小模型。本文提出一种基于视觉与语言桥接(BriVL)的鲁棒音频表征学习方法WavBriVL。WavBriVL将音频、图像与文本投影到共享嵌入空间,从而可实现多模态应用。我们以WavBriVL作为共享嵌入空间,展示图像生成的定性评估,本文主要目的为:(1) 学习音频与图像间的关联;(2) 探索一种新的图像生成方式,即用音频生成图片。实验结果表明,该方法能有效从音频生成恰当图像。
引用
@article{arxiv.2303.04585,
title = {Exploring Efficient-Tuned Learning Audio Representation Method from BriVL},
author = {Sen Fang and Yangjian Wu and Bowen Gao and Jingwen Cai and Teik Toe Teoh},
journal= {arXiv preprint arXiv:2303.04585},
year = {2023}
}
备注
13 pages, 2023.3 Finished