SAGE:面向标记高效的分段感知无术语签日语翻译
计算机视觉与模式识别
2026-05-29 v2
摘要
无术语签日语翻译(Gloss-free SLT)正在快速发展,取得了强大的性能,而无需依赖术语标注。然而,这些收益往往伴随着模型复杂度的增加和高计算需求,引发关于在更大规模签日语数据集变得更具可扩展性的担忧。我们提出一种分段感知视觉标记化框架,利用签日语分割将连续视频转换为离散且签日语感知的视觉标记。相较于先前方法,这种方法可将输入序列长度缩短最高50%,导致内存使用降低最高达2.67倍,更适合大规模数据集。为了桥接视觉与语言模态,我们引入一种标记到标记的对比式对齐目标,以及双层监督,同时对齐语言嵌入和中间隐藏状态。这一做法在不依赖术语级别监督的情况下改进了细粒度的跨模态对齐。我们的做法在PHOENIX14T基准测试上显著超过了最新方法,同时显著减少了序列长度。进一步的实验也表明,在相当相同的序列长度下,我们的做法优于先前工作,验证了我们标记化和对齐策略的潜力。
引用
@article{arxiv.2507.09266,
title = {SAGE: Segment-Aware Gloss-Free Encoding for Token-Efficient Sign Language Translation},
author = {JianHe Low and Ozge Mercanoglu Sincan and Richard Bowden},
journal= {arXiv preprint arXiv:2507.09266},
year = {2026}
}
备注
Accepted in International Conference on Computer Vision (ICCV) Workshops. Code released at https://github.com/JianHe0628/SAGE