中文

面向多语言环境的面部-声纹关联挑战(FAME)2026 评估计划

计算机视觉与模式识别 2025-09-30 v2

摘要

技术的进步推动了多模态系统在众多实际应用中的广泛采用,其中音视频系统是最常用的多模态系统之一。近年来,由于面部与声纹之间独特的关联性,关联面部与声纹已受到关注。面向多语言环境的面部-声纹关联挑战(FAME 2026)聚焦于在多语言场景下的面部-声纹关联问题。这种场景灵感来自于全球人口的一半是双语者,且人们常在多语言环境中交流。该挑战采用名为Multilingual Audio-Visual(MAV-Celeb)的数据集来探索多语言环境中的面部-声纹关联。本报告提供该挑战的细节、数据集、基线模型及任务细节。

关键词

引用

@article{arxiv.2508.04592,
  title  = {Face-voice Association in Multilingual Environments (FAME) 2026 Challenge Evaluation Plan},
  author = {Marta Moscati and Ahmed Abdullah and Muhammad Saad Saeed and Shah Nawaz and Rohan Kumar Das and Muhammad Zaigham Zaheer and Junaid Mir and Muhammad Haroon Yousaf and Khalid Malik and Markus Schedl},
  journal= {arXiv preprint arXiv:2508.04592},
  year   = {2025}
}

备注

4 pages, ICASSP'26, SP Grand Challenge'26