USAD:通过蒸馈实现通用语音与音频表示
声音
2025-08-19 v2 计算与语言
音频与语音处理
摘要
自监督学习 (SSL) 已彻底改变音频表示,但模型往往局限于特定领域,仅关注语音或非语音任务。在本工作中,我们提出通用语音与音频蒸馈 (USAD),一种统一的音频表示学习方法,将多样化音频类型(语音、声音和音乐)整合到单个模型中。USAD 采用高效的层级蒸馈,从领域特定 SSL 模型蒸馈以训练 student 在全面音频数据集上。USAD 在各种基准和数据集上实现竞争的性能,包括帧级和实例级语音处理任务、音频标记和声音分类,在 SUPERB 和 HEAR 基准上仅通过单个 encoder 即可实现接近最新成果。
引用
@article{arxiv.2506.18843,
title = {USAD: Universal Speech and Audio Representation via Distillation},
author = {Heng-Jui Chang and Saurabhchand Bhati and James Glass and Alexander H. Liu},
journal= {arXiv preprint arXiv:2506.18843},
year = {2025}
}
备注
Accepted to ASRU 2025