我见你所闻:一种受视觉启发定位词语的方法
计算机视觉与模式识别
2022-10-26 v1 机器学习
声音
音频与语音处理
摘要
本文探讨了利用视觉目标检测技术对语音数据中的词语进行定位的可能性。目标检测在当代文献中已针对视觉数据被充分研究。注意到音频可解释为一张一维图像,目标定位技术从根本上可用于词语定位。基于这一想法,我们提出了一种轻量级的词语检测与定位方案。我们使用边界框回归进行词语定位,使我们的模型能够检测给定音频流中关键词的出现、偏移和时长。我们在 LibriSpeech 上实验并训练了一个定位 1000 个词语的模型。与现有工作相比,我们的方法将模型大小减少了 94%,并将 F1 分数提高了 6.5\%。
引用
@article{arxiv.2210.13567,
title = {I see what you hear: a vision-inspired method to localize words},
author = {Mohammad Samragh and Arnav Kundu and Ting-Yao Hu and Minsik Cho and Aman Chadha and Ashish Shrivastava and Oncel Tuzel and Devang Naik},
journal= {arXiv preprint arXiv:2210.13567},
year = {2022}
}