中文

通过视觉知识迁移在无并行数据下连接音频与文本

声音 2022-05-04 v2 计算与语言 计算机视觉与模式识别 音频与语音处理

摘要

能够表示和描述环境声景的机器具有实际潜力,例如用于音频标记和字幕系统。现有的学习范式依赖于并行音频-文本数据,然而这类数据在网络上非常稀缺。我们提出了 VIP-ANT,它在不使用任何并行音频-文本数据的情况下实现音频-文本对齐。我们的核心思想是在双模态图像-文本表示和双模态图像-音频表示之间共享图像模态;图像模态作为枢轴,在三模态嵌入空间中隐式地连接音频和文本。在没有配对音频-文本数据的困难零样本设置下,我们的模型在 ESC50 和 US8K 音频分类任务上展示了最先进的零样本性能,甚至在 Clotho 字幕检索(以音频为查询)上以 2.2% 的 R@1 超越了有监督的最先进水平。我们进一步研究了少量音频-文本监督的情况,发现例如仅需几百个有监督的音频-文本对,就能将 US8K 上的零样本音频分类准确率提高 8%。然而,为了在某些零样本任务上达到人类水平,我们的经验缩放实验表明,我们将需要大约 2212M2^{21} \approx 2M 个有监督的音频-字幕对。我们的工作为在极少甚至没有并行音频-文本数据下学习音频-文本连接开辟了新途径。

关键词

引用

@article{arxiv.2112.08995,
  title  = {Connecting the Dots between Audio and Text without Parallel Data through Visual Knowledge Transfer},
  author = {Yanpeng Zhao and Jack Hessel and Youngjae Yu and Ximing Lu and Rowan Zellers and Yejin Choi},
  journal= {arXiv preprint arXiv:2112.08995},
  year   = {2022}
}

备注

Accepted to NAACL 2022. Our code is available at https://github.com/zhaoyanpeng/vipant