学习说话人不变的视觉特征用于唤读
计算机视觉与模式识别
2025-06-10 v1 计算与语言
摘要
唤读是一项具有挑战性的跨模态任务,旨在将视觉唤读运动转换为 spoken text。现有的唤读方法常提取包含说话人特定唤读属性(如形状、颜色、纹理)的视觉特征,这些属性在视觉和文本之间引入了虚假的相关性。这些相关性导致唤读准确率不佳,并限制了模型的泛化能力。为此,我们引入 SIFLip,一个说话人不变的视觉特征学习框架,通过两个互补的解耦模块(隐式解耦和显式解耦)来分离说话人特定属性,以提高泛化能力。具体而言,由于不同说话人在发音相同单词时显示出唤读运动与 phonetic text 之间的语义一致性,我们的隐式解耦模块利用稳定的文本嵌入作为监督信号,学习跨说话人的通用视觉表征,隐式地解耦说话人特定特征。此外,我们在主唤读管道中设计一个说话人识别子任务,以过滤说话人特定特征,然后通过梯度反转进一步显式地从主干网络中解耦这些个人化视觉特征。实验结果表明,SIFLip 在多个公开数据集上显著提升了泛化性能。实验结果表明,SIFLip 在多个公开数据集上显著提高了泛化性能,超越了最新方法。
引用
@article{arxiv.2506.07572,
title = {Learning Speaker-Invariant Visual Features for Lipreading},
author = {Yu Li and Feng Xue and Shujie Li and Jinrui Zhang and Shuang Yang and Dan Guo and Richang Hong},
journal= {arXiv preprint arXiv:2506.07572},
year = {2025}
}