基于文本描述还是发声模仿的声音搜索?
人机交互
2019-07-23 v1 声音
音频与语音处理
摘要
通过文本标签搜索声音通常较为困难,因为文本描述无法详尽刻画音频内容。基于发声模仿的查询弥补了这一差距,为声音搜索提供了新途径。已有若干用于发声模仿声音搜索的算法在仿真环境中被提出并评估,但它们尚未部署至真实搜索引擎,也未由真实用户评估。本试点工作开展主观研究以比较这两种声音搜索方法,并尝试回答何种方法更适用于哪类声音的问题。为此,我们开发了两种基于网络的声音搜索引擎:一种基于发声模仿(Vroom!),另一种基于文本描述(TextSearch)。我们还搭建了一个实验框架来承载这些引擎,以收集用户行为与评分统计。结果表明,对于受试者难以用文本描述的声音类别,Vroom! 的搜索满意度评分显著高于 TextSearch。结果还显示,在我们实验的有限声音库中,Vroom! 的整体易用性评分优于 TextSearch。这些发现表明基于发声模仿的声音搜索在实践中具有优势。
引用
@article{arxiv.1907.08661,
title = {Sound Search by Text Description or Vocal Imitation?},
author = {Yichi Zhang and Yiting Zhang and Zhiyao Duan},
journal= {arXiv preprint arXiv:1907.08661},
year = {2019}
}
备注
5 pages, 3 figures