中文

面向音频-文本跨检索的音频-图像时间一致性知识迁移精炼

音频与语音处理 2024-03-19 v1 声音

摘要

本研究旨在精炼面向音频-文本跨检索的音频-图像时间一致性知识迁移。为解决非语音音频-文本数据配对 availability 有限的问题,研究了从大量配对音频-图像数据迁移学习知识到共享音频-文本表征的方法,这表明了如何学习音频-图像共现的重要性。传统方法在音频-图像学习中分配单个随机选取的图像到整个音频片段,假设其共现。然而,这种方法可能不准确地捕获目标音频与图像之间的时间一致性,因为单个图像只能代表场景的一个瞬间,而目标音频会随时间不断变化。为解决此问题,我们提出两种音频-图像匹配方法,以有效捕获时间信息:(i) 最近匹配 (Nearest Match),其中从多个时间帧中选择与音频最相似的图像;(ii) 多帧匹配 (Multiframe Match),其中使用多个时间帧的音频-图像对。实验结果表明,方法 (i) 通过选择与音频信息相匹配的最近图像来传递所学知识,从而提升了音频-文本检索性能。相反,方法 (ii) 在音频-图像检索方面取得了性能提升,但在音频-文本检索方面并未显示出显著的改进。这类结果表明,精炼音频-图像时间一致性可能有助于更好地将知识迁移到音频-文本检索中。

关键词

引用

@article{arxiv.2403.10756,
  title  = {Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval},
  author = {Shunsuke Tsubaki and Daisuke Niizumi and Daiki Takeuchi and Yasunori Ohishi and Noboru Harada and Keisuke Imoto},
  journal= {arXiv preprint arXiv:2403.10756},
  year   = {2024}
}

备注

Submitted to EUSIPCO2024