中文

多模态序列中缺失元素的符号接地关联

计算机视觉与模式识别 2017-12-08 v5 计算与语言 机器学习 神经与进化计算

摘要

在本文中,我们扩展了一个符号关联框架,以能够处理多模态序列中的缺失元素。工作的总体范围是物体-词语映射的符号关联,正如婴儿语言发展中所发生的那样。换句话说,同一抽象概念的不同表示可以双向关联。该场景长期以来引起人工智能、心理学和神经科学的兴趣。在这项工作中,我们扩展了最近的一种用于多模态序列(视觉和音频)的方法,以同时应对一种或两种模态中的缺失元素。我们的方法使用两个并行的长短期记忆网络(LSTMs),其学习规则基于EM算法。它通过动态时间规整(DTW)对齐两个LSTM的输出。我们提出包含一个额外的步骤,通过max操作进行组合,以利用两个序列之间的公共元素。其动机在于该组合充当条件选择器,用于从两个LSTM中选择最佳表示。我们在以下场景中评估了所提出的扩展:一种模态(视觉或音频)中的缺失元素,以及两种模态(视觉和声音)中的缺失元素。我们的扩展性能达到了比原始模型更好的结果,并且与在每个模态中单独训练的LSTM相似的结果。

关键词

引用

@article{arxiv.1511.04401,
  title  = {Symbol Grounding Association in Multimodal Sequences with Missing Elements},
  author = {Federico Raue and Andreas Dengel and Thomas M. Breuel and Marcus Liwicki},
  journal= {arXiv preprint arXiv:1511.04401},
  year   = {2017}
}

备注

Under review on Journal of Artificial Intelligence Research (JAIR) -- Special Track on Deep Learning, Knowledge Representation, and Reasoning