中文

USAD:通过蒸馈实现通用语音与音频表示

声音 2025-08-19 v2 计算与语言 音频与语音处理

摘要

自监督学习 (SSL) 已彻底改变音频表示,但模型往往局限于特定领域,仅关注语音或非语音任务。在本工作中,我们提出通用语音与音频蒸馈 (USAD),一种统一的音频表示学习方法,将多样化音频类型(语音、声音和音乐)整合到单个模型中。USAD 采用高效的层级蒸馈,从领域特定 SSL 模型蒸馈以训练 student 在全面音频数据集上。USAD 在各种基准和数据集上实现竞争的性能,包括帧级和实例级语音处理任务、音频标记和声音分类,在 SUPERB 和 HEAR 基准上仅通过单个 encoder 即可实现接近最新成果。

关键词

引用

@article{arxiv.2506.18843,
  title  = {USAD: Universal Speech and Audio Representation via Distillation},
  author = {Heng-Jui Chang and Saurabhchand Bhati and James Glass and Alexander H. Liu},
  journal= {arXiv preprint arXiv:2506.18843},
  year   = {2025}
}

备注

Accepted to ASRU 2025