中文

面向低资源印度语言的跨语言与多语言语音词检测

计算与语言 2020-11-13 v1

摘要

语音词检测(STD)是指在音频中搜索词或短语的任务,其查询输入可以是文本或语音。在本工作中,我们使用最先进的印地语、泰米尔语和泰卢固语 ASR 系统,以跨语言方式在十种低资源印度语言中执行词汇语音词检测。由于这些语言尚无公开的语音词检测数据集,我们利用公开的 TTS 数据集构建了一个新数据集。我们报告了 STD 的标准指标——平均词加权值(MTWV),并表明在与目标语言语音相似的语言上构建的 ASR 系统具有更高的准确率;然而,通过使用宽松的音子匹配算法,也可在不相似的语言上获得较高的 MTWV 分数。我们提出了一种利用公开可用资源,在考虑的所有语言之间自举字素到音子(g2p)映射的技术。当我们组合多个 ASR 系统的输出并使用特定于语言的语言模型时,获得了性能提升。我们表明,可以以零样本方式跨语言执行 STD,而无需任何特定语言的语音数据。我们计划将该 STD 数据集提供给对跨语言 STD 感兴趣的其他研究者。

关键词

引用

@article{arxiv.2011.06226,
  title  = {Cross-lingual and Multilingual Spoken Term Detection for Low-Resource Indian Languages},
  author = {Sanket Shah and Satarupa Guha and Simran Khanuja and Sunayana Sitaram},
  journal= {arXiv preprint arXiv:2011.06226},
  year   = {2020}
}

备注

5 pages, 2 figures, 6 tables, 17 references