中文

TACOS:用于语言-音频预训练的时间对齐音频捕获语料

音频与语音处理 2025-05-13 v1 机器学习 声音

摘要

学习将音频与文本描述关联对于各种任务都很重要,包括预训练、零样本分类、音频检索、音频描述生成和文本条件音频生成。现有的对比式语言-音频预训练模型通常使用全局、片段级别的描述进行训练,这仅提供较弱的时间监督。我们假设,特别是如果它们被期望产生帧级嵌入,CLAP等语言-音频模型可以从更强的时间监督中受益。为确认这一假设,我们从 Freesound curated 约 12,000 条音频录音的数据集,每条录音都标注了与音频录音中特定时间段相关联的单句自由文本描述。我们使用大型语言模型清理这些标注,通过删除对不可听见事件的引用、转录的语音、拼写错误和标注者语言偏见。我们进一步提出了一种基于帧的对比训练策略,学习将文本描述与音频录音中的时间区域对齐,并在 AudioSet Strong 数据集上评估,我们的模型在与仅在全局标题上训练的模型相比,具有更好的时序文本-音频对齐能力。该数据集和我们的源代码分别可在 Zenodo 和 GitHub 上获取。

关键词

引用

@article{arxiv.2505.07609,
  title  = {TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining},
  author = {Paul Primus and Florian Schmid and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2505.07609},
  year   = {2025}
}

备注

submitted to the IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA), 2025. Dataset (Zenodo): https://zenodo.org/records/15379789, Implementation (GitHub): https://github.com/OptimusPrimus/tacos