利用多头视听记忆区分同形异音唇读单元
计算机视觉与模式识别
2022-04-06 v1
摘要
从无声唇部运动识别语音(称为唇读)是一项具有挑战性的任务,原因有二:1)唇部运动本身信息不足,无法完整表征语音;2)存在同形异音(homophene),即唇部运动相似但发音不同。本文试图通过提出一种多头视听记忆(Multi-head Visual-audio Memory, MVM)来缓解唇读中的上述两个挑战。首先,MVM在音视频数据集上训练,并通过建模配对音视频表征之间的相互关系来记忆音频表征。在推理阶段,仅视觉输入即可通过考察学习到的相互关系从记忆中提取已保存的音频表征。因此,唇读模型可利用提取的音频表征补充不足的视觉信息。其次,MVM由用于保存视觉特征的多头键记忆和用于保存音频知识的单一值记忆组成,旨在区分同形异音。借助多头键记忆,MVM从记忆中提取可能的候选音频特征,使唇读模型能够考虑输入唇部运动可表征哪些发音的可能性。这也可视为视位到音位一对多映射的显式实现。此外,MVM在多时间层级上应用,以在检索记忆和区分同形异音时考虑上下文。大量实验结果验证了所提方法在唇读及区分同形异音方面的有效性。
引用
@article{arxiv.2204.01725,
title = {Distinguishing Homophenes Using Multi-Head Visual-Audio Memory for Lip Reading},
author = {Minsu Kim and Jeong Hun Yeo and Yong Man Ro},
journal= {arXiv preprint arXiv:2204.01725},
year = {2022}
}
备注
Published at AAAI 2022