中文

音视频融合架构在身份核验任务中的行为研究

机器学习 2023-11-10 v1 计算机视觉与模式识别 声音 音频与语音处理

摘要

我们训练了一个身份核验架构,并评估了对模型中融合音频与视觉表示部分的修改,包括在待比较的两个样本之一缺失某一种输入的情形下。我们在 Voxceleb1-E 测试集上报告的结果表明,对输出嵌入取平均可改善完整模态情形及单一模态缺失时的错误率,且比使用共享层的系统更充分地利用嵌入空间,并讨论了造成此行为的可能原因。

关键词

引用

@article{arxiv.2311.05071,
  title  = {On the Behavior of Audio-Visual Fusion Architectures in Identity Verification Tasks},
  author = {Daniel Claborne and Eric Slyman and Karl Pazdernik},
  journal= {arXiv preprint arXiv:2311.05071},
  year   = {2023}
}