中文

通过多头注意力学习音视频亲和性改进视觉语音增强网络

音频与语音处理 2022-07-01 v1 多媒体 声音

摘要

音视频语音增强系统被视为分离并增强目标说话人语音的有前景方案之一。典型方法侧重于通过基于朴素卷积神经网络的编码器-解码器架构预测干净语音谱,这些方法 a) 未能充分利用数据,b) 无法有效平衡音视频特征。所提模型通过以下方式缓解这些缺陷:a) 采用在编码阶段逐层融合音频与视觉特征、并将融合后的音视频特征送入各对应解码器层的模型;更重要的是,b) 引入两阶段多头交叉注意力(MHCA)机制来推断音视频语音增强,以平衡融合的音视频特征并消除无关特征。本文提出注意力音视频多层特征融合模型,其中 MHCA 单元应用于解码器每一层的特征映射。所提模型展示了相对于最优模型的优越性能。

关键词

引用

@article{arxiv.2206.14964,
  title  = {Improving Visual Speech Enhancement Network by Learning Audio-visual Affinity with Multi-head Attention},
  author = {Xinmeng Xu and Yang Wang and Jie Jia and Binbin Chen and Dejun Li},
  journal= {arXiv preprint arXiv:2206.14964},
  year   = {2022}
}

备注

Accepted by Interspeech 2022. arXiv admin note: substantial text overlap with arXiv:2101.06268