以更少样本实现视觉基元的少样本词习得
计算与语言
2023-05-31 v1 人工智能
音频与语音处理
摘要
我们提出一种视觉基元语音模型,能从极少词-图像样例对中习得新词及其视觉表征。给定一组测试图像与一条语音查询,我们让模型判断哪幅图像描绘该查询词。先前工作或通过数字词-图像对的人工设定,或每类使用大量样例,简化了此问题。我们提出的方法可处理自然词-图像对且只需更少样例,即更少样本。我们的方法利用给定的词-图像样例对,从大规模无标注语音与图像集合中挖掘新的无监督词-图像训练对。此外,我们采用词到图像注意力机制来确定词-图像相似度。凭借这一新模型,我们以更少样本取得了优于所有现有方法的性能。
引用
@article{arxiv.2305.15937,
title = {Visually grounded few-shot word acquisition with fewer shots},
author = {Leanne Nortje and Benjamin van Niekerk and Herman Kamper},
journal= {arXiv preprint arXiv:2305.15937},
year = {2023}
}
备注
Accepted at Interspeech 2023