中文

基于辅助检索模型的 EnCLAP 扩展:用于自动音频描述生成

音频与语音处理 2024-09-04 v1 人工智能 声音

摘要

本技术报告描述了我们对 DCASE2024 挑战任务 6(自动音频描述生成)和任务 8(基于语言的音频检索)的提交方案。我们在 EnCLAP 音频描述生成框架基础上开发了方法,并针对挑战的任务 6 进行了优化。值得注意的是,我们概述了底层组件的变更以及reranking过程的融入。此外,我们提交了一个补充检索模型,这是我们修改框架的副产品,用于任务 8。我们提出的系统在任务 6 上获得了 0.542 的 FENSE 分数,在任务 8 上获得了 0.386 的 mAP@10 分数,显著优于基线模型。

关键词

引用

@article{arxiv.2409.01160,
  title  = {Expanding on EnCLAP with Auxiliary Retrieval Model for Automated Audio Captioning},
  author = {Jaeyeon Kim and Jaeyoon Jung and Minjeong Jeon and Sang Hoon Woo and Jinjoo Lee},
  journal= {arXiv preprint arXiv:2409.01160},
  year   = {2024}
}

备注

DCASE2024 Challenge Technical Report. Ranked 2nd in Task 6 Automated Audio Captioning