跨模态检索训练中的数据泄漏:一项案例研究
声音
2023-08-29 v1 计算与语言
信息检索
机器学习
音频与语音处理
摘要
近期基于文本的声音检索进展很大程度上由合适数据集的发布推动。由于此类数据集的手动创建是一项费力的工作,从在线资源获取数据可作为创建大规模数据集的廉价方案。我们研究了近期提出的 SoundDesc 基准数据集,其自动采集自 BBC Sound Effects 网页。在分析中,我们发现 SoundDesc 包含若干重复项,导致训练数据泄漏至评估数据。该数据泄漏最终使先前基准中的检索性能估计过于乐观。我们提出了新的训练、验证与测试划分,并已在线发布。为避免测试数据的微弱污染,我们将具有相似录音设置的音频文件归并。实验中,我们发现新划分构成了更具挑战性的基准。
引用
@article{arxiv.2302.12258,
title = {Data leakage in cross-modal retrieval training: A case study},
author = {Benno Weck and Xavier Serra},
journal= {arXiv preprint arXiv:2302.12258},
year = {2023}
}
备注
5 pages. Accepted at ICASSP2023