中文

Catplayinginthesnow:先验分词对视觉接地语音模型的影响

计算与语言 2020-10-21 v2

摘要

语言习得文献表明,儿童并非通过将口语输入分割为音素再由此构建词语来建立其词汇,而是采用自上而下的方法,先分割出类词单元再将其拆解为更小单元。这表明学习语言的理想方式是从完整语义单元开始。在本文中,我们探究对于在语音-图像检索任务上训练的视觉接地语音(Visually Grounded Speech)神经模型而言是否同样如此。我们评估了当提供音素、音节或词边界信息时,此类网络学习可靠语音到图像映射的能力。我们提出了一种将此类信息引入基于 RNN 的模型的简单方法,并探究哪种边界类型最高效。我们还探索了应在网络架构的哪一层引入此类信息以最大化其性能。最后,我们展示了在层次化结构中同时使用多种边界类型(由低层段重组出高层段)是有益的,且比单独使用低层或高层段取得更好结果。

关键词

引用

@article{arxiv.2006.08387,
  title  = {Catplayinginthesnow: Impact of Prior Segmentation on a Model of Visually Grounded Speech},
  author = {William N. Havard and Jean-Pierre Chevrot and Laurent Besacier},
  journal= {arXiv preprint arXiv:2006.08387},
  year   = {2020}
}

备注

Accepted at CoNLL20