中文

真实低资源场景下改进的视觉提示关键词定位

计算与语言 2025-11-27 v2 计算机视觉与模式识别 音频与语音处理

摘要

给定图像查询,视觉提示关键词定位(VPKL)旨在从语音集合中找到所描绘单词的出现位置。当低资源语言(例如无文字语言)缺乏转录文本时,该方法非常有用。先前的研究表明,VPKL 可以通过在配对图像和无标签语音上训练的视觉基础语音模型来实现。但所有实验均在英语上进行。此外,转录文本被用于为对比损失获取正负样本对。本文引入了一种少样本学习方案,无需转录文本即可自动挖掘样本对。在英语上,这仅导致性能小幅下降。我们还首次在真实的低资源语言——约鲁巴语上考虑了 VPKL。虽然得分尚可,但与使用真实样本对相比,我们在此处观察到性能下降幅度更大,这是因为在约鲁巴语中挖掘的准确性较低。

关键词

引用

@article{arxiv.2409.06013,
  title  = {Improved Visually Prompted Keyword Localisation in Real Low-Resource Settings},
  author = {Leanne Nortje and Dan Oneata and Gabriel Pirlogeanu and Herman Kamper},
  journal= {arXiv preprint arXiv:2409.06013},
  year   = {2025}
}

备注

Accepted at SpeD 2025