HASRD:分层声学与语义表征解耦
音频与语音处理
2025-06-03 v1 声音
摘要
用于口语语言模型的有效语音表征必须在语义相关性与声学保真度之间取得平衡,以实现高质量重建。然而,现有方法难以同时实现两者。为了解决这一问题,我们引入了分层声学与语义表征解耦(Hierarchical Acoustic and Semantic Representation Disentanglement, HASRD,发音为 `hazard')框架,该框架将自监督学习表征因子化为离散的语义 token 和声学 token。HASRD 将语义表征分配给第一个码本,同时在后续码本中编码声学残差。这在实现高质量重建的同时保持了 ASR 性能。此外,我们提升了 HASRD 编码器的效率,在不影响重建质量的情况下改善了 ASR 性能。与 SpeechTokenizer 相比,HASRD 实现了 44% 的相对 WER 改进、更优的重建质量以及低 2 倍的比特率,证明了其在解耦声学与语义信息方面的有效性。
引用
@article{arxiv.2506.00843,
title = {HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement},
author = {Amir Hussein and Sameer Khurana and Gordon Wichern and Francois G. Germain and Jonathan Le Roux},
journal= {arXiv preprint arXiv:2506.00843},
year = {2025}
}