多模态序列中缺失元素的符号接地关联
计算机视觉与模式识别
2017-12-08 v5 计算与语言
机器学习
神经与进化计算
摘要
在本文中,我们扩展了一个符号关联框架,以能够处理多模态序列中的缺失元素。工作的总体范围是物体-词语映射的符号关联,正如婴儿语言发展中所发生的那样。换句话说,同一抽象概念的不同表示可以双向关联。该场景长期以来引起人工智能、心理学和神经科学的兴趣。在这项工作中,我们扩展了最近的一种用于多模态序列(视觉和音频)的方法,以同时应对一种或两种模态中的缺失元素。我们的方法使用两个并行的长短期记忆网络(LSTMs),其学习规则基于EM算法。它通过动态时间规整(DTW)对齐两个LSTM的输出。我们提出包含一个额外的步骤,通过max操作进行组合,以利用两个序列之间的公共元素。其动机在于该组合充当条件选择器,用于从两个LSTM中选择最佳表示。我们在以下场景中评估了所提出的扩展:一种模态(视觉或音频)中的缺失元素,以及两种模态(视觉和声音)中的缺失元素。我们的扩展性能达到了比原始模型更好的结果,并且与在每个模态中单独训练的LSTM相似的结果。
引用
@article{arxiv.1511.04401,
title = {Symbol Grounding Association in Multimodal Sequences with Missing Elements},
author = {Federico Raue and Andreas Dengel and Thomas M. Breuel and Marcus Liwicki},
journal= {arXiv preprint arXiv:1511.04401},
year = {2017}
}
备注
Under review on Journal of Artificial Intelligence Research (JAIR) -- Special Track on Deep Learning, Knowledge Representation, and Reasoning