中文

结合迁移学习与重构潜空间相似性正则化的自动音频字幕生成

计算与语言 2021-08-29 v1 声音 音频与语音处理

摘要

在本文中,我们研究了使用预训练音频神经网络(PANNs)的迁移学习,并提出了一种能够更好地利用 PANNs 提供的声学特征以完成自动音频字幕生成任务的架构。我们还引入了一种新的自监督目标,即重构潜空间相似性正则化(RLSSR)。RLSSR 模块通过最小化编码器与解码器嵌入之间的相似性来辅助模型的训练。这两种方法的结合使我们在 Clotho 数据集上的多项指标和基准测试中大幅超越了现有最优结果。

关键词

引用

@article{arxiv.2108.04692,
  title  = {Automated Audio Captioning using Transfer Learning and Reconstruction Latent Space Similarity Regularization},
  author = {Andrew Koh and Fuzhao Xue and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2108.04692},
  year   = {2021}
}

备注

to be submitted to icassp 2022