中文

AMSS-Net:基于文本查询对用户指定声源进行音频变换

音频与语音处理 2021-04-29 v1 机器学习 声音

摘要

本文提出一种神经网络,其根据给定描述对给定音轨中用户指定的声源(如人声)进行音频变换,同时保留描述中未提及的其他声源。特定声源上的音频变换(AMSS)具有挑战性,因为声音对象(即波形采样点或频率 bin)是“透明”的;与图像中的像素不同,它通常携带来自多个声源的信息。为解决这一挑战性问题,我们提出 AMSS-Net,其提取潜在声源并有选择地对其进行操纵,同时保留无关声源。我们还提出了若干 AMSS 任务的评测基准,并通过客观指标与经验验证表明 AMSS-Net 在多项 AMSS 任务上优于基线方法。

关键词

引用

@article{arxiv.2104.13553,
  title  = {AMSS-Net: Audio Manipulation on User-Specified Sources with Textual Queries},
  author = {Woosung Choi and Minseok Kim and Marco A. Martínez Ramírez and Jaehwa Chung and Soonyoung Jung},
  journal= {arXiv preprint arXiv:2104.13553},
  year   = {2021}
}

备注

10 pages, 8 figures, 3 tables, under reviewing of ACMMM 21