音视频融合架构在身份核验任务中的行为研究
机器学习
2023-11-10 v1 计算机视觉与模式识别
声音
音频与语音处理
摘要
我们训练了一个身份核验架构,并评估了对模型中融合音频与视觉表示部分的修改,包括在待比较的两个样本之一缺失某一种输入的情形下。我们在 Voxceleb1-E 测试集上报告的结果表明,对输出嵌入取平均可改善完整模态情形及单一模态缺失时的错误率,且比使用共享层的系统更充分地利用嵌入空间,并讨论了造成此行为的可能原因。
引用
@article{arxiv.2311.05071,
title = {On the Behavior of Audio-Visual Fusion Architectures in Identity Verification Tasks},
author = {Daniel Claborne and Eric Slyman and Karl Pazdernik},
journal= {arXiv preprint arXiv:2311.05071},
year = {2023}
}