面向人脸-语音关联的共享多模态嵌入空间
声音
2025-12-05 v1 计算机视觉与模式识别
摘要
FAME 2026 挑战包含两个艰巨任务:训练面脸-语音关联并包含多语言设置,这包括对模型未训练的语言进行测试。我们的做法包含独立的单模态处理管线,进行通用的面部和语音特征提取,并补充额外的年龄-性别特征提取以支持预测。 resulting single-modal features are projected into a shared embedding space and trained with an Adaptive Angular Margin (AAM) loss. 我们的做法在 FAME 2026 挑战中获得了第一名,平均等于错误率(EER)为 23.99\%。
引用
@article{arxiv.2512.04814,
title = {Shared Multi-modal Embedding Space for Face-Voice Association},
author = {Christopher Simic and Korbinian Riedhammer and Tobias Bocklet},
journal= {arXiv preprint arXiv:2512.04814},
year = {2025}
}
备注
Ranked 1st in Fame 2026 Challenge, ICASSP