JOOCI:学习综合语音表示的框架
计算与语言
2025-02-19 v3
摘要
语音信息可分为两组:内容 (例如语言学方面的信息) 和 Other (例如说话人信息和副语言特征的表达方式)。当前的自监督学习 (SSL) 方法显示,模型的表示深度或层数被分为两部分,早期层专注于 Other,后期层专注于 Content 相关任务。这种层级划分是次优的,因为 neither 信息类型都能利用所有层来构建层次表示。为此,我们提出了 JOOCI,一种不为 either 信息类型牺牲表示深度的新型语音表示学习方法。JOOCI 在 SUPERB 基准测试中的两个说话人识别和两个语言任务上,相较于 WavLM 提升了 26.5%,其他参数规模相近的模型 (1 亿参数),显示出在 Jointly Optimizing Other and Content Information (JOOCI) 中的有效性。
引用
@article{arxiv.2410.11086,
title = {JOOCI: a Framework for Learning Comprehensive Speech Representations},
author = {Hemant Yadav and Rajiv Ratn Shah and Sunayana Sitaram},
journal= {arXiv preprint arXiv:2410.11086},
year = {2025}
}
备注
Submitted to ICLR 2025