中文

用于自动音频描述的离散音频表示

声音 2025-05-22 v1 音频与语音处理

摘要

离散音频表示,称为音频标记,广泛分为语义标记和声学标记,通常通过对连续音频表示进行无监督标记化来生成。然而,它们在自动音频描述(AAC)中的适用性尚未得到充分探索。本文系统地研究了音频标记驱动模型用于AAC的可行性,通过对各种标记化方法进行比较分析。我们的发现表明,与直接利用连续音频表示的AAC模型相比,音频标记化在AAC模型中导致性能下降。为解决此问题,我们引入了一个基于音频标记化目标训练的监督式音频标记器。与无监督标记器不同,后者缺乏明确的语义理解,所提出的标记器有效地捕获了音频事件信息。在Clotho数据集上进行的实验表明,所提出的音频标记在AAC任务中优于常规音频标记。

关键词

引用

@article{arxiv.2505.14989,
  title  = {Discrete Audio Representations for Automated Audio Captioning},
  author = {Jingguang Tian and Haoqin Sun and Xinhui Hu and Xinkang Xu},
  journal= {arXiv preprint arXiv:2505.14989},
  year   = {2025}
}

备注

Interspeech 2025