EnCLAP++:分析与优化自动音频描述生成框架
音频与语音处理
2024-09-04 v1 人工智能
声音
摘要
本文旨在分析和优化自动音频描述生成框架EnCLAP——一款领先的模型。我们研究了修改声学编码器组件的影响,探索了不同数据规模的预训练,以及重排序方案的有效性。通过大量实验和对生成描述的定量分析,我们开发了EnCLAP++,一个显著优于原版的增强版本。
引用
@article{arxiv.2409.01201,
title = {EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance},
author = {Jaeyeon Kim and Minjeon Jeon and Jaeyoon Jung and Sang Hoon Woo and Jinjoo Lee},
journal= {arXiv preprint arXiv:2409.01201},
year = {2024}
}
备注
Accepted to DCASE2024 Workshop