分段、嵌入、对齐:对齐字幕到手语的通用配方
计算与语言
2025-12-10 v1
摘要
本工作旨在开发一种通用的、将字幕(即带时间戳的口语文本)与连续手语视频对齐的方法。以往方法通常依赖于特定语言或数据集上的端到端训练,限制了其普适性。相比之下,我们的方法 Segment、Embed、Align(SEA)提供了一个单一框架,可跨多个语言和领域工作。SEA 利用两个预训练模型:第一个用于将视频帧序列分割为单个手势,第二个用于将每个手势的视频剪辑嵌入与文本共享的潜在空间。随后采用轻量级的动态规划程序进行对齐,在 CPU 上可在分钟内高效运行,即使是时长数小时的剧集也不在话下。SEA 灵活且可适应多种场景,能利用从小型词典到大型连续语料库的资源。实验在四个手语数据集上表现出领先的对齐性能,凸显了 SEA 用于生成高质量平行数据的潜力,以推动手语处理领域的发展。SEA 的代码和模型已公开开放。
引用
@article{arxiv.2512.08094,
title = {Segment, Embed, and Align: A Universal Recipe for Aligning Subtitles to Signing},
author = {Zifan Jiang and Youngjoon Jang and Liliane Momeni and Gül Varol and Sarah Ebling and Andrew Zisserman},
journal= {arXiv preprint arXiv:2512.08094},
year = {2025}
}