口语词的音形与语义嵌入及其在口语内容检索中的应用
计算与语言
2019-01-23 v4 声音
音频与语音处理
摘要
词嵌入或 Word2Vec 已成功地从词的上下文中学习出文本词的语义。Audio Word2Vec 被证明可从口语词(词的信号段)内部的信号中学习出口语词的音形结构。本文提出一个两阶段框架,考虑口语词的上下文来对口语词进行音形与语义嵌入。阶段 1 进行解耦说话人特征的音形嵌入。阶段 2 进而额外进行语义嵌入。我们进一步提出通过与文本嵌入并行化来评估阶段 2 所得音频嵌入的音形与语义性质。一般而言,音形结构与语义不可避免地相互干扰。例如 "brother" 与 "sister" 语义相近但音形结构差异很大,而 "brother" 与 "bother" 则相反。但音形与语义嵌入颇具吸引力,如口语文档检索的初步实验所示。不仅可基于音形结构检索到包含口语查询的口语文档,也可基于语义检索到与查询语义相关但不包含查询的口语文档。
引用
@article{arxiv.1807.08089,
title = {Phonetic-and-Semantic Embedding of Spoken Words with Applications in Spoken Content Retrieval},
author = {Yi-Chen Chen and Sung-Feng Huang and Chia-Hao Shen and Hung-yi Lee and Lin-shan Lee},
journal= {arXiv preprint arXiv:1807.08089},
year = {2019}
}
备注
Accepted at SLT2018