XM-ALIGN:面向面部-语音关联的统一跨模态嵌入对齐框架
声音
2026-04-29 v1 计算机视觉与模式识别
摘要
本文介绍我们的解决方案XM-ALIGN(Unified Cross-Modal Embedding Alignment Framework),用于ICASSP 2026的FAME挑战。我们的框架组合显式和隐式对齐机制,显著提升了两种语言(heard和unheard)中的跨模态验证性能。通过从面部和语音编码器中提取特征嵌入,并使用共享分类器联合优化,我们采用均方误差(MSE)作为嵌入对齐损失,以确保模态之间的紧密对齐。此外,应用数据增强策略以增强模型泛化性。实验结果表明,我们的方法在MAV-Celeb数据集上显示出卓越的性能。代码将在https://github.com/PunkMale/XM-ALIGN发布。
引用
@article{arxiv.2512.06757,
title = {XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association},
author = {Zhihua Fang and Shumei Tao and Junxu Wang and Liang He},
journal= {arXiv preprint arXiv:2512.06757},
year = {2026}
}
备注
FAME 2026 Technical Report