中文

面向人脸-语音关联的共享多模态嵌入空间

声音 2025-12-05 v1 计算机视觉与模式识别

摘要

FAME 2026 挑战包含两个艰巨任务:训练面脸-语音关联并包含多语言设置,这包括对模型未训练的语言进行测试。我们的做法包含独立的单模态处理管线,进行通用的面部和语音特征提取,并补充额外的年龄-性别特征提取以支持预测。 resulting single-modal features are projected into a shared embedding space and trained with an Adaptive Angular Margin (AAM) loss. 我们的做法在 FAME 2026 挑战中获得了第一名,平均等于错误率(EER)为 23.99\%。

关键词

引用

@article{arxiv.2512.04814,
  title  = {Shared Multi-modal Embedding Space for Face-Voice Association},
  author = {Christopher Simic and Korbinian Riedhammer and Tobias Bocklet},
  journal= {arXiv preprint arXiv:2512.04814},
  year   = {2025}
}

备注

Ranked 1st in Fame 2026 Challenge, ICASSP