中文

结合局部上下文感知特征提取与多任务学习增强视觉强制对齐

计算机视觉与模式识别 2025-03-06 v1

摘要

本文提出了一种新的视觉强制对齐(VFA)方法,旨在在不依赖音频线索的情况下准确同步语音与对应的唇部运动。我们提出了一种新的VFA方法,集成了局部上下文感知特征提取器,并采用多任务学习来精炼全局和局部上下文特征,增强对细微唇部运动的敏感性,以实现精确的词级和音素级对齐。结合改进的Viterbi算法进行后处理,我们的方法显著减少了对齐错误。实验结果表明,我们的方法优于现有方法,在LRS2数据集上实现了词级6%的准确率提升和音素级27%的提升。这些改进为自动给电视节目或TikTok和YouTube Shorts等用户生成内容平台添加字幕提供了新的潜力。

关键词

引用

@article{arxiv.2503.03286,
  title  = {Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning},
  author = {Yi He and Lei Yang and Shilin Wang},
  journal= {arXiv preprint arXiv:2503.03286},
  year   = {2025}
}

备注

Accepted by ICASSP2025