中文

通过优化音频编码增强自动音频描述

声音 2024-06-26 v2 计算与语言 音频与语音处理

摘要

自动音频描述(Automated Audio Captioning, AAC)是一种将音频内容描述为自然语言的音频到文本任务。最近,大型语言模型(LLM)的发展以及对音频编码器训练方法的改进,为提高 AAC 提供了可能。因此,我们从三个方面探索增强 AAC:1) 使用基于一致性集成蒸馏(Consistent Ensemble Distillation, CED)的预训练音频编码器用于提高声学标记的有效性,通过查询转换器(Q-Former)桥接模态差距并压缩声学标记;2) 我们研究使用 7B 参数的 Llama 2 作为解码器的优势;3) 另一个预训练 LLM 纠正由训练数据不足和标注模糊性导致的文本错误。音频编码器和文本解码器均通过低秩适应(LoRA)进行优化。实验表明,这些增强措施每个都有效。我们的方法获得了 33.0 的 SPIDEr-FL 分数,超过了 DCASE 2023 Task 6A 的获胜者。

关键词

引用

@article{arxiv.2406.13275,
  title  = {Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding},
  author = {Jizhong Liu and Gang Li and Junbo Zhang and Heinrich Dinkel and Yongqing Wang and Zhiyong Yan and Yujun Wang and Bin Wang},
  journal= {arXiv preprint arXiv:2406.13275},
  year   = {2024}
}

备注

Accepted by Interspeech 2024