中文

基于音频-文本共享隐表示的忠实引导参数高效音频描述

计算与语言 2023-09-08 v1 多媒体 声音

摘要

在多模态到文本生成任务中,开发预训练 transformer 架构已有大量研究。尽管性能有所提升,此类模型经常参数过剩,因而存在幻觉问题且内存占用大,难以部署在边缘设备上。在本文中,我们针对自动音频描述应用解决这两个问题。首先,我们提出一种数据增强技术用于生成幻觉音频描述,并表明基于音频-文本共享隐空间的相似性适合检测幻觉。然后,我们提出一种参数高效的推理时忠实解码算法,使较小的音频描述模型获得与用更多数据训练的大模型相当的性能。在束搜索解码步骤中,较小模型利用音频-文本共享隐表示将生成文本与相应输入音频进行语义对齐。通过将贪婪展开的中间束与音频片段的隐表示投影之间的余弦相似度纳入束概率,将忠实引导引入束概率。我们在基准数据集上展示了我们算法的有效性,并使用常规音频描述与语义相似性指标针对基线评估所提方案,同时说明了性能与复杂度之间的权衡。

关键词

引用

@article{arxiv.2309.03340,
  title  = {Parameter Efficient Audio Captioning With Faithful Guidance Using Audio-text Shared Latent Representation},
  author = {Arvind Krishna Sridhar and Yinyi Guo and Erik Visser and Rehana Mahfuz},
  journal= {arXiv preprint arXiv:2309.03340},
  year   = {2023}
}

备注

5 pages, 5 tables, 1 figure