中文

JOOCI:学习综合语音表示的框架

计算与语言 2025-02-19 v3

摘要

语音信息可分为两组:内容 (例如语言学方面的信息) 和 Other (例如说话人信息和副语言特征的表达方式)。当前的自监督学习 (SSL) 方法显示,模型的表示深度或层数被分为两部分,早期层专注于 Other,后期层专注于 Content 相关任务。这种层级划分是次优的,因为 neither 信息类型都能利用所有层来构建层次表示。为此,我们提出了 JOOCI,一种不为 either 信息类型牺牲表示深度的新型语音表示学习方法。JOOCI 在 SUPERB 基准测试中的两个说话人识别和两个语言任务上,相较于 WavLM 提升了 26.5%,其他参数规模相近的模型 (1 亿参数),显示出在 Jointly Optimizing Other and Content Information (JOOCI) 中的有效性。

关键词

引用

@article{arxiv.2410.11086,
  title  = {JOOCI: a Framework for Learning Comprehensive Speech Representations},
  author = {Hemant Yadav and Rajiv Ratn Shah and Sunayana Sitaram},
  journal= {arXiv preprint arXiv:2410.11086},
  year   = {2025}
}

备注

Submitted to ICLR 2025