SyncVSR:基于端到端跨模态音频标记同步的数据高效视觉语音识别
人工智能
2024-06-19 v1 计算与语言
计算机视觉与模式识别
摘要
视觉语音识别(VSR)处于计算机视觉和语音识别的交叉领域,旨在从视觉线索中解释 spoken content。VSR的一个突出挑战是同形词的存在,这些词在视觉上相似,但代表不同的音素。先前的方法试图通过对齐视觉和听觉语义来区分细粒度的视网膜,但往往未能实现完全同步。为此,我们提出SyncVSR,一种端到端学习框架,利用量化音频进行帧级跨模态监督。通过集成一个投影层,将视觉表示与声学数据同步,我们的编码器学习以非自回归方式从视频序列中生成离散音频标记。SyncVSR在任务、语言和模态方面表现出多样性,代价仅为一次前向传播。我们的实验结果表明,它不仅实现了最先进的成果,还将数据使用量降低了最高可达九倍。
引用
@article{arxiv.2406.12233,
title = {SyncVSR: Data-Efficient Visual Speech Recognition with End-to-End Crossmodal Audio Token Synchronization},
author = {Young Jin Ahn and Jungwoo Park and Sangha Park and Jonghyun Choi and Kee-Eung Kim},
journal= {arXiv preprint arXiv:2406.12233},
year = {2024}
}