基于辅助检索模型的 EnCLAP 扩展:用于自动音频描述生成
音频与语音处理
2024-09-04 v1 人工智能
声音
摘要
本技术报告描述了我们对 DCASE2024 挑战任务 6(自动音频描述生成)和任务 8(基于语言的音频检索)的提交方案。我们在 EnCLAP 音频描述生成框架基础上开发了方法,并针对挑战的任务 6 进行了优化。值得注意的是,我们概述了底层组件的变更以及reranking过程的融入。此外,我们提交了一个补充检索模型,这是我们修改框架的副产品,用于任务 8。我们提出的系统在任务 6 上获得了 0.542 的 FENSE 分数,在任务 8 上获得了 0.386 的 mAP@10 分数,显著优于基线模型。
引用
@article{arxiv.2409.01160,
title = {Expanding on EnCLAP with Auxiliary Retrieval Model for Automated Audio Captioning},
author = {Jaeyeon Kim and Jaeyoon Jung and Minjeong Jeon and Sang Hoon Woo and Jinjoo Lee},
journal= {arXiv preprint arXiv:2409.01160},
year = {2024}
}
备注
DCASE2024 Challenge Technical Report. Ranked 2nd in Task 6 Automated Audio Captioning