中文

视觉接地语音信号模型中的语言表征

计算与语言 2018-10-30 v3 人工智能 机器学习

摘要

我们提出一种视觉接地的语音感知模型,其将口语话语和图像投影到联合语义空间。我们使用多层循环高速公路网络(recurrent highway network)对口语语音的时间特性进行建模,并表明它学会从输入信号中提取基于形式和意义的语言知识。我们对训练后模型不同组件所使用的表征进行了深入分析,表明语义方面的编码随着层层级上升趋于更丰富,而语言输入中形式相关方面的编码倾向于先增加然后趋于平稳或下降。

关键词

引用

@article{arxiv.1702.01991,
  title  = {Representations of language in a model of visually grounded speech signal},
  author = {Grzegorz Chrupała and Lieke Gelderloos and Afra Alishahi},
  journal= {arXiv preprint arXiv:1702.01991},
  year   = {2018}
}

备注

Accepted at ACL 2017