学习语音与图像的模态不变表示
机器学习
2017-12-12 v1 计算与语言
计算机视觉与模式识别
摘要
在本文中,我们探索对共现感官输入进行语义嵌入空间的无监督学习。具体而言,我们聚焦于利用TIDIGITs和MNIST数据集为语音与手写数字学习语义向量空间的任务。当前技术将图像和音频/文本输入直接编码到语义嵌入中。相反,我们的技术将输入映射到对角高斯分布的均值和的对数方差向量,并从中采样语义嵌入。除了鼓励共现输入之间的语义相似性外,我们的损失函数还包含从变分自编码器(VAEs)借用的正则化项,该项将嵌入上的后验分布驱动为单位高斯分布。我们可以利用该正则化项在保留语义信息的同时过滤掉模态信息。我们推测该技术可更广泛地应用于跨模态/域信息检索与迁移学习的其他领域。
引用
@article{arxiv.1712.03897,
title = {Learning Modality-Invariant Representations for Speech and Images},
author = {Kenneth Leidal and David Harwath and James Glass},
journal= {arXiv preprint arXiv:1712.03897},
year = {2017}
}