CLAP-ART:基于语义丰富的音频表示分词器的自动音频描述
音频与语音处理
2025-06-03 v1 机器学习
声音
摘要
自动音频描述(AAC)旨在利用有效的声学特征描述一般声音的语义上下文,包括声学事件和场景。为了提升性能,一种 AAC 方法 EnCLAP 将来自 EnCodec 的离散分词作为微调语言模型 BART 的有效输入。然而,EnCodec 旨在重建波形,而非捕获 AAC 应当描述的一般声音的语义上下文。为了解决这个问题,我们提出了 CLAP-ART,一种利用“语义丰富且离散”分词作为输入的 AAC 方法。CLAP-ART 通过向量量化从预训练的音频表示中计算语义丰富的离散分词。我们通过实验证实,CLAP-ART 在两个 AAC 基准上优于基线 EnCLAP,这表明源自语义丰富 AR 的语义丰富离散分词对 AAC 是有益的。
引用
@article{arxiv.2506.00800,
title = {CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer},
author = {Daiki Takeuchi and Binh Thien Nguyen and Masahiro Yasuda and Yasunori Ohishi and Daisuke Niizumi and Noboru Harada},
journal= {arXiv preprint arXiv:2506.00800},
year = {2025}
}
备注
Accepted to Interspeech2025