中文

低资源场景下的视觉接地少样本词学习

音频与语音处理 2024-04-19 v3 计算与语言

摘要

我们提出了一种视觉接地的语音模型,该模型仅从少量词-图像示例对中学习新词及其视觉描绘。给定一组测试图像和一段口语查询,我们让模型判断哪幅图像描绘了查询词。以往工作通过采用数字词-图像对的人工设定或每类使用大量示例来简化这一少样本学习问题。此外,所有先前研究均使用英语语音-图像数据完成。我们提出一种可处理自然词-图像对且示例更少(即更少样本)的方法,并进而展示该方法如何应用于真实低资源语言 Yorùbá 的多模态少样本学习。我们的方法利用给定的词-图像示例对,从大规模无标注语音与图像集合中挖掘新的无监督词-图像训练对。此外,我们使用词到图像的注意力机制来确定词-图像相似度。借助这一新模型,我们在现有英语基准上以更少样本取得了优于以往方法的性能。该模型的许多错误源于相似语境中共现的视觉概念间的混淆。在 Yorùbá 上的实验显示了从在更大数据集英语语音-图像上训练的多模态模型迁移知识的益处。

关键词

引用

@article{arxiv.2306.11371,
  title  = {Visually grounded few-shot word learning in low-resource settings},
  author = {Leanne Nortje and Dan Oneata and Herman Kamper},
  journal= {arXiv preprint arXiv:2306.11371},
  year   = {2024}
}

备注

Accepted to TASLP. arXiv admin note: substantial text overlap with arXiv:2305.15937