AV-SepFormer:用于视听目标说话人提取的交叉注意力SepFormer
多媒体
2023-06-27 v1 声音
音频与语音处理
摘要
视觉信息可作为目标说话人提取(TSE)的有效线索,并对提升提取性能至关重要。本文中,我们提出AV-SepFormer,一种基于SepFormer的注意力双尺度模型,利用交叉注意力和自注意力融合并建模来自音频与视觉的特征。AV-SepFormer将音频特征分割为若干块,其长度等同于视觉特征的长度。随后采用自注意力与交叉注意力对多模态特征进行建模与融合。此外,我们使用一种新颖的2D位置编码,引入了块间与块内的位置信息,相较传统位置编码带来了显著增益。我们的模型具有两个关键优势:音频分块特征的时间粒度与视觉特征同步,减轻了音视频采样率不一致带来的损害;通过结合自注意力与交叉注意力,特征融合与语音提取过程在注意力范式内统一。实验结果表明,AV-SepFormer显著优于其他现有方法。
引用
@article{arxiv.2306.14170,
title = {AV-SepFormer: Cross-Attention SepFormer for Audio-Visual Target Speaker Extraction},
author = {Jiuxin Lin and Xinyu Cai and Heinrich Dinkel and Jun Chen and Zhiyong Yan and Yongqing Wang and Junbo Zhang and Zhiyong Wu and Yujun Wang and Helen Meng},
journal= {arXiv preprint arXiv:2306.14170},
year = {2023}
}
备注
Accepted by ICASSP2023