中文

基于注意力的跨模态融合用于音乐视频流中的视听语音活动检测

声音 2021-06-23 v1 音频与语音处理

摘要

许多以往的视听语音相关工作聚焦于言语,忽略了互联网上日益增长的音乐视频流中的歌唱声。为处理多样的音乐视频数据,语音活动检测是必要步骤。本文尝试利用视听信息检测音乐视频流中目标表演者的言语与歌唱声。为整合音频与视觉模态的信息,提出一种多分支网络以学习音频与图像表示,并基于语义相似度通过注意力将表示融合,借助锚定发声概率塑造声学表示。实验表明,所提出的视听多分支网络在挑战性声学环境中远优于仅音频模型,表明基于语义关联的跨模态信息融合是合理且成功的。

关键词

引用

@article{arxiv.2106.11411,
  title  = {Attention-based cross-modal fusion for audio-visual voice activity detection in musical video streams},
  author = {Yuanbo Hou and Zhesong Yu and Xia Liang and Xingjian Du and Bilei Zhu and Zejun Ma and Dick Botteldooren},
  journal= {arXiv preprint arXiv:2106.11411},
  year   = {2021}
}

备注

Accepted by INTERSPEECH 2021