MASR:多标签感知语音表征
声音
2023-09-26 v2 计算与语言
机器学习
音频与语音处理
摘要
近年来,语音表征学习主要被构建为自监督学习(SSL)任务,仅使用原始音频信号,而忽略了给定语音录音常可用的侧信息。本文提出 MASR,一种多标签感知语音表征学习框架,以解决上述局限。MASR 支持引入多个外部知识源以增强元数据信息的利用。外部知识源以样本级成对相似度矩阵的形式融入,该矩阵在困难样本挖掘损失中发挥作用。MASR 框架的一个关键优势是可结合任意 SSL 方法使用。利用 MASR 表征,我们在若干下游任务上进行了评估,如语言识别、语音识别以及其他非语义任务如说话人与情感识别。在这些实验中,我们展示了 MASR 相对于其他既定基准的显著性能提升。我们对语言识别任务做了详细分析,以揭示所提损失函数如何使表征分离相近语言。
引用
@article{arxiv.2307.10982,
title = {MASR: Multi-label Aware Speech Representation},
author = {Anjali Raj and Shikhar Bharadwaj and Sriram Ganapathy and Min Ma and Shikhar Vashishth},
journal= {arXiv preprint arXiv:2307.10982},
year = {2023}
}
备注
Accepted at ASRU 2023