中文

用于最大类间分离的归纳偏置人脸-语音关联

计算机视觉与模式识别 2026-01-21 v1

摘要

人脸-语音关联在多模态学习中得到广泛研究,其方法是通过嵌入来表示人脸和语音,使得同一人的嵌入相互接近且与其他人的嵌入充分分离。先前的工作通过损失函数实现了这一点。分类领域的最新进展表明,通过将最大类间分离作为归纳偏置,可以增强嵌入的判别能力。该技术从未被用于人脸-语音关联领域,本工作旨在填补这一空白。更具体地说,我们开发了一种人脸-语音关联方法,将不同说话人多模态表示间的最大类间分离作为归纳偏置。通过定量实验,我们证明了该方法的有效性,表明它在人脸-语音关联的两种任务表述上均达到了 SOTA 性能。此外,我们进行了消融研究,表明将归纳偏置与类间正交性损失相结合时最为有效。据我们所知,本工作是首个在多模态学习中应用并证明最大类间分离作为归纳偏置有效性的工作;从而为建立新范式铺平了道路。

关键词

引用

@article{arxiv.2601.13651,
  title  = {Face-Voice Association with Inductive Bias for Maximum Class Separation},
  author = {Marta Moscati and Oleksandr Kats and Mubashir Noman and Muhammad Zaigham Zaheer and Yufang Hou and Markus Schedl and Shah Nawaz},
  journal= {arXiv preprint arXiv:2601.13651},
  year   = {2026}
}

备注

Accepted at ICASSP 2026