中文

用于多视角声学词嵌入的非对称代理损失

音频与语音处理 2022-06-28 v2 声音

摘要

声学词嵌入(AWEs)是语音片段的判别性表示,所学嵌入空间反映了词之间的音素相似性。在多视角学习中,文本标签被视为补充输入,AWEs 与声学接地词嵌入(AGWEs)联合训练。在本文中,我们通过将 AGWEs 等同于代理,将多视角方法扩展为基于代理的深度度量学习框架。计算相似度矩阵时的简单修改允许通用成对加权来表述数据到代理的关系。在该系统化框架下,我们提出了一种非对称代理损失,其在保持各自优点的同时非对称地组合不同部分的损失函数。它遵循如下假设:锚点-正样本对的最优函数可能不同于锚点-负样本对的最优函数,且当代理在三元组中替代不同位置时可能产生不同影响。我们给出了与各种基于代理的损失(包括我们的非对称代理损失)的对比实验,并在 WSJ 语料库上评估了用于词判别任务的 AWEs 和 AGWEs。结果证明了所提方法的有效性。

关键词

引用

@article{arxiv.2203.16080,
  title  = {Asymmetric Proxy Loss for Multi-View Acoustic Word Embeddings},
  author = {Myunghun Jung and Hoirin Kim},
  journal= {arXiv preprint arXiv:2203.16080},
  year   = {2022}
}

备注

Accepted to Interspeech 2022