中文

跨模态检索训练中的数据泄漏:一项案例研究

声音 2023-08-29 v1 计算与语言 信息检索 机器学习 音频与语音处理

摘要

近期基于文本的声音检索进展很大程度上由合适数据集的发布推动。由于此类数据集的手动创建是一项费力的工作,从在线资源获取数据可作为创建大规模数据集的廉价方案。我们研究了近期提出的 SoundDesc 基准数据集,其自动采集自 BBC Sound Effects 网页。在分析中,我们发现 SoundDesc 包含若干重复项,导致训练数据泄漏至评估数据。该数据泄漏最终使先前基准中的检索性能估计过于乐观。我们提出了新的训练、验证与测试划分,并已在线发布。为避免测试数据的微弱污染,我们将具有相似录音设置的音频文件归并。实验中,我们发现新划分构成了更具挑战性的基准。

关键词

引用

@article{arxiv.2302.12258,
  title  = {Data leakage in cross-modal retrieval training: A case study},
  author = {Benno Weck and Xavier Serra},
  journal= {arXiv preprint arXiv:2302.12258},
  year   = {2023}
}

备注

5 pages. Accepted at ICASSP2023