TDFNet:一种基于自顶向下融合的高效音视频语音分离模型
声音
2024-01-26 v1 人工智能
音频与语音处理
摘要
近年来,音视频语音分离因其在语音识别、说话人日志、场景分析和辅助技术等多个领域的潜在应用而受到广泛关注。设计轻量级的音视频语音分离网络对于低延迟应用至关重要,但现有方法往往需要更高的计算成本和更多的参数才能实现更好的分离性能。本文提出了一种名为 Top-Down-Fusion Net (TDFNet) 的音视频语音分离模型,这是一种用于音视频语音分离的 SOTA 模型,它建立在仅音频语音分离方法 TDANet 的架构之上。TDANet 作为 TDFNet 中听觉和视觉网络的架构基础,提供了一个参数较少的高效模型。在 LRS2-2Mix 数据集上,与之前的 SOTA 方法 CTCNet 相比,TDFNet 在所有性能指标上均实现了高达 10% 的性能提升。值得注意的是,这些结果是在使用更少参数且仅需 CTCNet 28% 的乘加运算次数 (MACs) 的情况下取得的。本质上,我们的方法为音视频领域的语音分离挑战提供了一种高效且有效的解决方案,在优化利用视觉信息方面取得了重大进展。
引用
@article{arxiv.2401.14185,
title = {TDFNet: An Efficient Audio-Visual Speech Separation Model with Top-down Fusion},
author = {Samuel Pegg and Kai Li and Xiaolin Hu},
journal= {arXiv preprint arXiv:2401.14185},
year = {2024}
}