面向零资源口语的视觉提示关键词定位
计算与语言
2022-10-13 v1 声音
音频与语音处理
摘要
设想能够向系统展示某个关键词的视觉描绘,并从零资源语音语料库中找出包含该关键词的口语话语。我们形式化此任务并称之为视觉提示关键词定位 (VPKL):给定关键词的一幅图像,检测并预测该关键词在话语中出现的部位。为进行 VPKL,我们提出一种具有新颖定位注意力机制的语音-视觉模型,并以一种新的关键词采样方案训练之。我们展示这些创新在 VPKL 上相较已有语音-视觉模型带来改进。我们还与一种视觉词袋 (BoW) 模型比较,其中图像被自动标注视觉标签并与无标签语音配对。尽管该视觉词袋可直接以书写关键词查询(而我们的模型接受图像查询),我们的新模型在检测与定位上仍优于视觉词袋,在定位 F1 上取得 16% 的相对提升。
引用
@article{arxiv.2210.06229,
title = {Towards visually prompted keyword localisation for zero-resource spoken languages},
author = {Leanne Nortje and Herman Kamper},
journal= {arXiv preprint arXiv:2210.06229},
year = {2022}
}
备注
Accepted to IEEE SLT 2022