如何从自监督模型中提取离散音频标记?
声音
2024-06-18 v1 人工智能
计算与语言
音频与语音处理
摘要
离散音频标记最近因其在弥合音频和语言处理之间差距方面的潜力而受到关注。理想的音频标记必须保留内容、副语言元素、说话人身份以及许多其他音频细节。当前的音频标记化方法分为两类:语义标记,通过量化自监督学习(SSL)模型获得;以及基于神经压缩的标记(编解码器)。尽管先前的研究已经对编解码器模型进行了基准测试以确定最优配置,但量化预训练SSL模型的理想设置仍不清楚。本文探讨了语义标记在判别和生成任务中的最优配置。我们提出了一种可扩展的解决方案,用于跨多个SSL层训练通用声码器。此外,采用注意力机制来识别特定任务的影响层,增强了语义标记在各种音频应用中的适应性和性能。
引用
@article{arxiv.2406.10735,
title = {How Should We Extract Discrete Audio Tokens from Self-Supervised Models?},
author = {Pooneh Mousavi and Jarod Duret and Salah Zaiem and Luca Della Libera and Artem Ploujnikov and Cem Subakan and Mirco Ravanelli},
journal= {arXiv preprint arXiv:2406.10735},
year = {2024}
}
备注
4 pages, 2 figures, 2 tables, Accepted at Interspeech 2024