FLAP:快速语言-音频预训练
声音
2023-11-06 v1 计算与语言
音频与语音处理
摘要
我们提出快速语言-音频预训练(FLAP),一种自监督方法,通过掩码、对比学习和重建高效且有效地学习对齐的音频与语言表示。为提升效率,FLAP随机丢弃音频频谱图令牌,仅对剩余令牌进行自监督。通过跨模态对比学习,FLAP学习在共享潜在空间中对齐成对的音频与文本表示。值得注意的是,FLAP利用通过掩码得到的多个增强视图进行跨模态对比,并学习重建被掩码的音频令牌部分。此外,FLAP利用大语言模型(LLM)扩充文本输入,从而提升性能。这些方法带来了更鲁棒且更具信息量的音频-文本表示,使FLAP在AudioCaps(达到53.0% R@1)和Clotho(达到25.5% R@1)的音频-文本检索任务上取得最先进(SoTA)性能。
引用
@article{arxiv.2311.01615,
title = {FLAP: Fast Language-Audio Pre-training},
author = {Ching-Feng Yeh and Po-Yao Huang and Vasu Sharma and Shang-Wen Li and Gargi Gosh},
journal= {arXiv preprint arXiv:2311.01615},
year = {2023}
}
备注
6 pages