语音与图像多模态单样本匹配中无监督学习与迁移学习的比较
计算与语言
2020-08-17 v1 计算机视觉与模式识别
声音
音频与语音处理
摘要
我们考虑多模态单样本语音-图像匹配任务。向智能体展示一幅图片以及描述图中物体的一个口语词,例如饼干、西兰花和冰淇淋。在每类观察一个配对的语音-图像样例后,向其展示一组新的未见图片,并要求挑出“冰淇淋”。先前工作尝试使用迁移学习解决该问题:在有标签的背景数据上训练监督模型,这些背景数据不包含任何单样本类别。此处我们将迁移学习与在无标签领域内数据上训练的无监督模型进行比较。在一个配对的孤立语音与视觉数字数据集上,我们具体比较无监督类自编码器模型与监督分类器及 Siamese 神经网络。在单模态与多模态少样本匹配实验中,我们发现迁移学习优于无监督训练。我们还给出了结合两种方法的实验,但发现迁移学习仍表现最佳(尽管理想化实验显示了无监督学习的益处)。
引用
@article{arxiv.2008.06258,
title = {Unsupervised vs. transfer learning for multimodal one-shot matching of speech and images},
author = {Leanne Nortje and Herman Kamper},
journal= {arXiv preprint arXiv:2008.06258},
year = {2020}
}
备注
Accepted at Interspeech 2020