语音与图像的多模态单样本学习
计算与语言
2019-04-16 v2 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
设想一个机器人同时以视觉及口语标签形式看到新概念,例如“牛奶”、“鸡蛋”、“黄油”。在每类仅看到一个配对的视听样本后,向其展示这些对象的一组新未见实例,并被要求挑出“牛奶”。在没有任何硬标签的情况下,它能否学会将新的连续语音输入匹配到正确的视觉实例?尽管单模态单样本学习——即每类在单一模态下给定一个带标签样本——已被研究,该例却引出了多模态单样本学习。我们的主要贡献是形式化定义该任务,并提出若干基线模型与进阶模型。我们使用配对口语与视觉数字的数据集,具体探究 Siamese 卷积神经网络的最新进展。在 11 路跨模态匹配中,我们最优的 Siamese 模型准确率为使用图像像素距离与语音动态时间规整的最近邻模型的两倍。
引用
@article{arxiv.1811.03875,
title = {Multimodal One-Shot Learning of Speech and Images},
author = {Ryan Eloff and Herman A. Engelbrecht and Herman Kamper},
journal= {arXiv preprint arXiv:1811.03875},
year = {2019}
}
备注
5 pages, 1 figure, 3 tables; accepted to ICASSP 2019