IIANet:一种用于音视觉语音分离的模内与模间注意力网络
声音
2024-02-05 v3 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
近期研究在音视觉语音分离的融合模块设计上取得显著进展。然而,它们主要聚焦于在听觉与视觉特征的单一时间尺度上进行多模态融合,而未采用选择性注意力机制,这与大脑的工作方式形成鲜明对比。为解决该问题,我们提出一种称为模内与模间注意力网络(Intra- and Inter-Modality Attention Network, IIANet)的新模型,其利用注意力机制实现高效的音视觉特征融合。IIANet 由两类注意力块组成:模内注意力(IntraA)与模间注意力(InterA)块,其中 InterA 块分布于 IIANet 的顶部、中部和底部。受人类大脑在不同时间尺度上选择性关注相关内容的方式启发,这些块保持学习模态特定特征的能力,并能从音视觉特征中提取不同语义。在三个标准音视觉分离基准(LRS2、LRS3 和 VoxCeleb2)上的综合实验证明了 IIANet 的有效性,在保持可比推理时间的同时优于先前最先进方法。特别地,IIANet 的快速版本(IIANet-fast)仅拥有 CTCNet 7% 的 MACs,且在 CPU 上比 CTCNet 快 40%,同时取得更优分离质量,展示了注意力机制在高效且有效多模态融合上的巨大潜力。
引用
@article{arxiv.2308.08143,
title = {IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation},
author = {Kai Li and Runxuan Yang and Fuchun Sun and Xiaolin Hu},
journal= {arXiv preprint arXiv:2308.08143},
year = {2024}
}
备注
18 pages, 6 figures