中文

使用卷积神经网络的音频区间检索

声音 2021-09-22 v1 人工智能 音频与语音处理

摘要

现代流媒体服务日益基于视频的视觉或音频内容为其添加标签。这通常通过利用 AI 和 ML 等技术,允许使用自然语言语音按关键词和视频描述进行搜索来加以增强。先前研究已成功提供若干针对人类语音的语音转文本解决方案,但本文旨在研究基于自然语言查询检索声音事件的可能方案,并评估其有效性与准确性。在本研究中,我们具体聚焦于 YamNet、AlexNet 和 ResNet-50 预训练模型,利用其各自的梅尔频谱图将音频样本自动分类为若干预定义类别。这些预定义类别可表示视频片段中与动作相关的声音。我们进行了两项测试,以在音频分类和基于自然语言查询的区间检索这两个独立问题上评估模型性能。结果表明,受基准测试的模型性能相当,其中 YamNet 略优于另外两个模型。YamNet 对单个固定大小音频样本的分类准确率为 92.7%、精确率为 68.75%,而其区间检索的平均准确率为 71.62%、精确率为 41.95%。所研究的方法可嵌入流媒体服务的自动事件标记架构中。

关键词

引用

@article{arxiv.2109.09906,
  title  = {Audio Interval Retrieval using Convolutional Neural Networks},
  author = {Ievgeniia Kuzminykh and Dan Shevchuk and Stavros Shiaeles and Bogdan Ghita},
  journal= {arXiv preprint arXiv:2109.09906},
  year   = {2021}
}

备注

20th International Conference on Next Generation Teletraffic and Wired/Wireless Advanced Networks and Systems, NEW2AN 2020 and 13th Conference on the Internet of Things and Smart Spaces, ruSMART 2020