DGFNet:基于动态门控融合的端到端音视频源分离
声音
2025-05-01 v1 人工智能
摘要
当前音视频源分离方法主要采用两种设计策略。第一种策略在编码器的瓶颈层融合音频与视觉特征,随后通过解码器处理融合特征。但当两种模态差异显著时,可能导致关键信息丢失。第二种策略避免直接融合,依赖解码器处理音频与视觉特征之间的相互作用。然而,若编码器未能充分整合跨模态信息,解码器可能无法有效捕获两者的复杂关系。为此,本文提出一种基于门控机制的动态融合方法,动态调整模态融合程度,缓解仅依赖解码器的局限,促进音视频特征的高效协作。此外,引入音频注意力模块以提升音频特征的表征能力,进一步提高模型性能。实验结果表明,我们的方法在两个基准数据集上实现显著性能提升,验证了其在音视频源分离任务中的有效性与优势。
引用
@article{arxiv.2504.21366,
title = {DGFNet: End-to-End Audio-Visual Source Separation Based on Dynamic Gating Fusion},
author = {Yinfeng Yu and Shiyu Sun},
journal= {arXiv preprint arXiv:2504.21366},
year = {2025}
}
备注
Main paper (9 pages). Accepted for publication by ICMR(International Conference on Multimedia Retrieval) 2025