中文

基于文本的音频检索相关性众包标注与评估

音频与语音处理 2023-08-16 v2 声音

摘要

本文探讨利用众包评估对基于文本的音频检索相关性进行打分。给定一段自由文本(如描述文字)作为查询,众包工作者被要求使用数值分数(0 到 100 之间)对音频片段进行评级,以表明他们认为音频片段的声音内容与文本匹配程度的判断,其中 0 表示完全无内容匹配,100 表示完美内容匹配。我们将众包相关性整合到基于文本的音频检索系统的训练与评估中,并评估将其与来自音频字幕的二值相关性一起使用的效果。传统上,这些二值相关性由基于字幕的音频-字幕对定义,其中正类表示该字幕描述了配对的音频,负类适用于所有其他配对。实验结果表明,当众包相关性为对比学习而二值化时,将其与二值相关性结合使用并无明显收益。相反,结果表明仅使用由基于字幕的音频-字幕对定义的二值相关性即足以用于对比学习。

关键词

引用

@article{arxiv.2306.09820,
  title  = {Crowdsourcing and Evaluating Text-Based Audio Retrieval Relevances},
  author = {Huang Xie and Khazar Khorrami and Okko Räsänen and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2306.09820},
  year   = {2023}
}

备注

Accepted at DCASE 2023 Workshop