开放词汇关键词检测中跨模态音频-文本对齐的对抗深度度量学习
音频与语音处理
2025-05-26 v2 人工智能
摘要
对于基于文本注册的开放词汇关键词检测(KWS),声学嵌入和文本嵌入通常在音素或话语层面进行比较。为此,我们利用深度度量学习(DML)优化声学编码器和文本编码器,实现多模态嵌入在共享嵌入空间中的直接比较。然而,音频和文本模态之间的固有异质性构成了重大挑战。为解决这一问题,我们提出模态对抗学习(MAL),以减少异构模态表示之间的领域差距。具体而言,我们对抗性地训练一个模态分类器,以鼓励两个编码器生成模态不变的嵌入。此外,我们应用 DML 实现音素级别的音频与文本对齐,并在各种 DML 目标上进行了广泛比较。在 Wall Street Journal(WSJ)和 LibriPhrase 数据集上的实验验证了所提方法的有效性。
引用
@article{arxiv.2505.16735,
title = {Adversarial Deep Metric Learning for Cross-Modal Audio-Text Alignment in Open-Vocabulary Keyword Spotting},
author = {Youngmoon Jung and Yong-Hyeok Lee and Myunghun Jung and Jaeyoung Roh and Chang Woo Han and Hoon-Young Cho},
journal= {arXiv preprint arXiv:2505.16735},
year = {2025}
}
备注
5 pages, 1 figure, Accepted at Interspeech 2025