中文

EnCLAP++:分析与优化自动音频描述生成框架

音频与语音处理 2024-09-04 v1 人工智能 声音

摘要

本文旨在分析和优化自动音频描述生成框架EnCLAP——一款领先的模型。我们研究了修改声学编码器组件的影响,探索了不同数据规模的预训练,以及重排序方案的有效性。通过大量实验和对生成描述的定量分析,我们开发了EnCLAP++,一个显著优于原版的增强版本。

关键词

引用

@article{arxiv.2409.01201,
  title  = {EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance},
  author = {Jaeyeon Kim and Minjeon Jeon and Jaeyoon Jung and Sang Hoon Woo and Jinjoo Lee},
  journal= {arXiv preprint arXiv:2409.01201},
  year   = {2024}
}

备注

Accepted to DCASE2024 Workshop