CASTELLA:带标题和时间边界的长时段音频数据集
音频与语音处理
2026-01-30 v2 计算与语言
声音
摘要
我们介绍CASTELLA,这是一个人工标注的音频基准数据集,用于音频时段检索 (Audio Moment Retrieval, AMR) 任务。尽管AMR具有多种有用的潜在应用,但目前尚无采用真实世界数据的数据集。以往的AMR研究仅使用合成数据集训练模型,而且评估数据集样本不足100个,这导致报告的性能可靠性较低。为确保在真实世界环境下的实际应用性能,我们提出CASTELLA,这是一个大规模人工标注的AMR数据集。CASTELLA包含1009个、213个和640个音频录音,分别用于训练、验证和测试,规模是该数据集中规模最大的数据集,大约是24倍。我们还建立了使用CASTELLA的AMR基线模型。我们的实验表明,在合成数据上进行预训练后使用CASTELLA微调的模型,相对于仅在合成数据上训练的模型在[email protected]指标上提升了10.4分。CASTELLA已公开提供,网址为https://h-munakata.github.io/CASTELLA-demo/。
引用
@article{arxiv.2511.15131,
title = {CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries},
author = {Hokuto Munakata and Takehiro Imamura and Taichi Nishimura and Tatsuya Komatsu},
journal= {arXiv preprint arXiv:2511.15131},
year = {2026}
}
备注
Accepted by ICASSP 2026