约束你的嵌入:用于端到端口语理解的跨模态潜在空间
音频与语音处理
2021-04-16 v2 计算与语言
声音
摘要
端到端(E2E)口语理解(SLU)系统可以直接从音频信号中推断出口语话语的语义。然而,训练 E2E 系统仍然是一个挑战,这主要是由于配对的音频-语义数据的稀缺性。在本文中,我们将 E2E 系统视为一个多模态模型,其中音频和文本作为其两种模态,并使用跨模态潜在空间(CMLS)架构,在“声学”嵌入和“文本”嵌入之间学习一个共享的潜在空间。我们提出使用不同的多模态损失,以显式地引导声学嵌入更接近从语义强大的预训练 BERT 模型中获得的文本嵌入。我们在两个公开可用的 E2E 数据集上训练 CMLS 模型,测试不同的跨模态损失,结果表明我们提出的 triplet loss 函数取得了最佳性能。与没有跨模态空间的 E2E 模型相比,它分别实现了 1.4% 和 4% 的相对提升,与使用 损失的先前发表的 CMLS 模型相比,实现了 0.7% 和 1% 的相对提升。对于更小、更复杂的 E2E 数据集,增益更高,这证明了使用高效的跨模态损失函数的有效性,尤其是在可用的 E2E 训练数据有限的情况下。
关键词
引用
@article{arxiv.2011.09044,
title = {Tie Your Embeddings Down: Cross-Modal Latent Spaces for End-to-end Spoken Language Understanding},
author = {Bhuvan Agrawal and Markus Müller and Martin Radfar and Samridhi Choudhary and Athanasios Mouchtaris and Siegfried Kunzmann},
journal= {arXiv preprint arXiv:2011.09044},
year = {2021}
}
备注
7 pages, 6 figures