中文

基于多任务学习的双耳音频生成

声音 2021-09-03 v1 音频与语音处理

摘要

我们提出一种基于学习的方法,利用多任务学习从单声道音频生成双耳音频。我们的公式利用了来自两个相关任务的额外信息:双耳音频生成任务与翻转音频分类任务。我们的学习模型从视觉与音频输入中提取空间化特征,预测左右音频声道,并判断左右声道是否被翻转。首先,我们使用 ResNet 从视频帧中提取视觉特征。接下来,基于视觉特征使用独立子网络进行双耳音频生成与翻转音频分类。我们的学习方法基于两个任务损失的加权和优化总体损失。我们在 FAIR-Play 数据集与 YouTube-ASMR 数据集上训练并评估模型。我们进行了定量与定性评估,以展示相较先前技术的优势。

关键词

引用

@article{arxiv.2109.00748,
  title  = {Binaural Audio Generation via Multi-task Learning},
  author = {Sijia Li and Shiguang Liu and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2109.00748},
  year   = {2021}
}