中文

基于注意力加权事件嵌入的自动音频描述

声音 2022-02-01 v1 机器学习 音频与语音处理

摘要

自动音频描述(AAC)是指将音频翻译成描述音频事件、事件来源及其关系的自然语言的任务。目前 AAC 数据集样本有限,这促使人们将迁移学习与作为父任务的音频事件检测(AED)相结合。在此方向上,本文提出一种编码器-解码器架构,采用轻量级(即可学习参数较少)的 Bi-LSTM 循环层用于 AAC,并比较了两种最先进的预训练 AED 模型作为嵌入提取器的性能。我们的结果表明,高效的基于 AED 的嵌入提取器结合时间注意力与增强技术,能够以计算密集型架构之外的更低代价超越现有文献。此外,我们提供的证据表明,作为模型一部分生成的非均匀注意力加权编码能够帮助解码器在生成每个词元时关注音频的特定片段。

关键词

引用

@article{arxiv.2201.12352,
  title  = {Automatic Audio Captioning using Attention weighted Event based Embeddings},
  author = {Swapnil Bhosale and Rupayan Chakraborty and Sunil Kumar Kopparapu},
  journal= {arXiv preprint arXiv:2201.12352},
  year   = {2022}
}