中文

基于音频相似描述检索引导的预训练大规模语言模型的音频描述生成

音频与语音处理 2020-12-15 v1 计算与语言 声音

摘要

音频描述生成的目标是用自然语言将输入音频翻译为其描述。音频描述生成中的一个问题是由于难以通过网络爬取收集音频-描述配对而导致训练数据缺乏。在本研究中,为克服该问题,我们提出使用预训练大规模语言模型。由于音频输入无法直接输入此类语言模型,我们利用基于不同音频间可能存在的相似性从训练数据集中检索得到的引导描述。然后,通过使用预训练语言模型并参考引导描述来生成音频输入的描述。实验结果表明:(i) 所提方法成功地将预训练语言模型用于音频描述生成;(ii) 基于预训练模型的描述生成器的 oracle 性能明显优于从头训练的传统方法。

关键词

引用

@article{arxiv.2012.07331,
  title  = {Audio Captioning using Pre-Trained Large-Scale Language Model Guided by Audio-based Similar Caption Retrieval},
  author = {Yuma Koizumi and Yasunori Ohishi and Daisuke Niizumi and Daiki Takeuchi and Masahiro Yasuda},
  journal= {arXiv preprint arXiv:2012.07331},
  year   = {2020}
}

备注

Submitted to ICASSP 2021