中文

用于音频字幕的音频差异学习

音频与语音处理 2023-09-18 v1 计算与语言 机器学习 声音 信号处理

摘要

本研究提出一种新颖的训练范式——音频差异学习,用于改进音频字幕。所提学习方法的基本理念是构建一个保留音频间关系的特征表示空间,从而生成描述精细音频信息的字幕。该方法采用参考音频与输入音频,二者通过共享编码器转换为特征表示,随后由这些差异特征生成字幕以描述其差异。此外,提出一种独特技术,将输入音频与额外音频混合,并以该额外音频作为参考。这使得混合音频与参考音频之间的差异还原为原始输入音频,从而可将原始输入的字幕用作其差异的字幕,无需为差异提供额外标注。在使用 Clotho 和 ESC50 数据集的实验中,所提方法相较常规方法在 SPIDEr 分数上提升了 7%。

关键词

引用

@article{arxiv.2309.08141,
  title  = {Audio Difference Learning for Audio Captioning},
  author = {Tatsuya Komatsu and Yusuke Fujita and Kazuya Takeda and Tomoki Toda},
  journal= {arXiv preprint arXiv:2309.08141},
  year   = {2023}
}

备注

submitted to ICASSP2024