中文

SSAVSV:迈向自监督音视频说话人验证的统一模型

计算机视觉与模式识别 2025-06-25 v1 声音 音频与语音处理

摘要

传统的音视频说话人验证方法依赖大量标注数据和独立的特定模态架构,计算成本高昂,限制了其可扩展性。为了解决这些问题,我们提出了一个基于带有非对称掩码的对比学习和掩码数据建模的自监督学习框架,以获取鲁棒的音视频特征表示。特别地,我们采用一个统一框架进行自监督音视频说话人验证,为音频和视觉输入使用单一共享骨干网络,利用视觉 Transformer 的多功能性。所提出的统一框架在训练和测试期间可以使用单一共享视觉 Transformer 骨干网络处理音频、视觉或音视频输入,同时计算高效且对缺失模态具有鲁棒性。大量实验表明,与传统方法相比,我们的方法在无需标注数据的情况下取得了有竞争力的性能,同时降低了计算成本。

关键词

引用

@article{arxiv.2506.17694,
  title  = {SSAVSV: Towards Unified Model for Self-Supervised Audio-Visual Speaker Verification},
  author = {Gnana Praveen Rajasekhar and Jahangir Alam},
  journal= {arXiv preprint arXiv:2506.17694},
  year   = {2025}
}