基于内容的音频表示学习:使用孪生神经网络
声音
2018-02-16 v3 信息检索
音频与语音处理
摘要
本文关注音频的基于内容检索问题,旨在针对给定音频片段查询检索所有语义相似的音频录音。该问题与音频的按例查询问题相似,后者旨在从数据库中检索与用户所提供示例相似的媒体样本。我们提出一种新方法,使用孪生神经网络将音频编码为向量表示。目标是使属于同一音频类的文件获得相似编码,从而允许检索语义相似的音频。利用基于简单欧氏距离和余弦相似度的简单相似性度量,我们表明这些表示可非常有效地用于检索音频内容相似的录音。
引用
@article{arxiv.1710.10974,
title = {Content-based Representations of audio using Siamese neural networks},
author = {Pranay Manocha and Rohan Badlani and Anurag Kumar and Ankit Shah and Benjamin Elizalde and Bhiksha Raj},
journal= {arXiv preprint arXiv:1710.10974},
year = {2018}
}