利用相似-差异解耦的音频差异描述生成
音频与语音处理
2023-08-24 v1 计算与语言
机器学习
声音
摘要
我们提出音频差异描述生成(ADC)作为音频描述生成的新扩展任务,用于描述输入相似但略有差异的音频片段对之间的语义差异。ADC解决了常规音频描述生成有时为相似音频片段生成相似描述、未能刻画内容差异的问题。我们还提出一种交叉注意力聚焦的Transformer编码器,通过比较一对音频片段来提取差异,以及一种相似-差异解耦方法,以在潜空间中突出差异。为评估所提方法,我们构建了AudioDiffCaps数据集,其由相似但略有差异的音频片段对组成,并带有人工标注的差异描述。基于AudioDiffCaps数据集的实验表明,所提方法有效解决了ADC任务,并通过在Transformer编码器中可视化注意力权重,提升了对差异提取的注意力。
引用
@article{arxiv.2308.11923,
title = {Audio Difference Captioning Utilizing Similarity-Discrepancy Disentanglement},
author = {Daiki Takeuchi and Yasunori Ohishi and Daisuke Niizumi and Noboru Harada and Kunio Kashino},
journal= {arXiv preprint arXiv:2308.11923},
year = {2023}
}
备注
Accepted to DCASE2023 Workshop