中文

基于语言的音频时段检索

音频与语音处理 2025-08-05 v3 计算与语言 声音

摘要

本文提出并设计了一个名为音频时段检索 (AMR) 的新任务。与传统基于语言的音频检索任务不同,后者在音频数据库中搜索短音频片段,而 AMR 旨在基于文本查询预测未修剪长音频中的相关时段。鉴于 AMR 领域缺乏先前工作,本文首先构建了一个包含大规模模拟音频录音并带有时段注释的数据集,即 Clotho-Moment。随后,我们提出一种基于 DETR 的模型,称为 Audio Moment DETR (AM-DETR),作为 AMR 任务的基本框架。该模型受视频时段检索任务的启发,捕获音频特征中的时序依赖性,从而超越传统的片段级音频检索方法。此外,我们提供了手动标注的数据集,以正确衡量我们方法在真实数据上的有效性和鲁棒性。实验结果表明,AM-DETR 在所有指标上均优于采用滑动窗口的片段级音频检索基线模型,尤其是将 [email protected] 提升了 9.00 分。我们的数据集和代码已公开于 https://h-munakata.github.io/Language-based-Audio-Moment-Retrieval。

关键词

引用

@article{arxiv.2409.15672,
  title  = {Language-based Audio Moment Retrieval},
  author = {Hokuto Munakata and Taichi Nishimura and Shota Nakada and Tatsuya Komatsu},
  journal= {arXiv preprint arXiv:2409.15672},
  year   = {2025}
}