结合局部上下文感知特征提取与多任务学习增强视觉强制对齐
计算机视觉与模式识别
2025-03-06 v1
摘要
本文提出了一种新的视觉强制对齐(VFA)方法,旨在在不依赖音频线索的情况下准确同步语音与对应的唇部运动。我们提出了一种新的VFA方法,集成了局部上下文感知特征提取器,并采用多任务学习来精炼全局和局部上下文特征,增强对细微唇部运动的敏感性,以实现精确的词级和音素级对齐。结合改进的Viterbi算法进行后处理,我们的方法显著减少了对齐错误。实验结果表明,我们的方法优于现有方法,在LRS2数据集上实现了词级6%的准确率提升和音素级27%的提升。这些改进为自动给电视节目或TikTok和YouTube Shorts等用户生成内容平台添加字幕提供了新的潜力。
引用
@article{arxiv.2503.03286,
title = {Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning},
author = {Yi He and Lei Yang and Shilin Wang},
journal= {arXiv preprint arXiv:2503.03286},
year = {2025}
}
备注
Accepted by ICASSP2025