中文

利用相似-差异解耦的音频差异描述生成

音频与语音处理 2023-08-24 v1 计算与语言 机器学习 声音

摘要

我们提出音频差异描述生成(ADC)作为音频描述生成的新扩展任务,用于描述输入相似但略有差异的音频片段对之间的语义差异。ADC解决了常规音频描述生成有时为相似音频片段生成相似描述、未能刻画内容差异的问题。我们还提出一种交叉注意力聚焦的Transformer编码器,通过比较一对音频片段来提取差异,以及一种相似-差异解耦方法,以在潜空间中突出差异。为评估所提方法,我们构建了AudioDiffCaps数据集,其由相似但略有差异的音频片段对组成,并带有人工标注的差异描述。基于AudioDiffCaps数据集的实验表明,所提方法有效解决了ADC任务,并通过在Transformer编码器中可视化注意力权重,提升了对差异提取的注意力。

关键词

引用

@article{arxiv.2308.11923,
  title  = {Audio Difference Captioning Utilizing Similarity-Discrepancy Disentanglement},
  author = {Daiki Takeuchi and Yasunori Ohishi and Daisuke Niizumi and Noboru Harada and Kunio Kashino},
  journal= {arXiv preprint arXiv:2308.11923},
  year   = {2023}
}

备注

Accepted to DCASE2023 Workshop