SLRTP2025手语生成挑战赛:方法、结果与未来工作
计算机视觉与模式识别
2025-08-12 v1 图像与视频处理
信号处理
摘要
手语生成(SLP)是指从口语输入生成手语视频的任务。在过去几年中,随着基于深度学习方法的引入,该领域取得了一系列创新,显著提升了生成输出的真实感和自然度。然而,SLP方法缺乏标准化的评估指标,阻碍了不同系统间的有意义的比较。为了解决这一问题,我们举办了首届手语生成挑战赛,该赛事作为CVPR 2025第三届SLRTP研讨会的一部分。竞赛旨在通过一系列指标,评估将口语语句翻译为骨架姿态序列(即文本到姿态(T2P)翻译)的架构。我们使用RWTH-PHOENIX-Weather-2014T数据集(一个德国手语——Deutsche Gebardensprache (DGS) 的天气预报数据集)作为评估数据。此外,我们还从类似的话语领域整理了一个自定义的隐藏测试集。本文介绍了挑战赛的设计和获胜方法。该挑战赛吸引了33名参与者,提交了231个解决方案,表现最佳的团队取得了31.40的BLEU-1分数和0.0574的DTW-MJE。获胜方案采用了一个基于检索的框架和一个预训练语言模型。作为研讨会的一部分,我们发布了一个标准化的评估网络,包括基于高质量骨架提取的关键点,为SLP领域建立了一致的基线,这将使未来的研究人员能够将他们的工作与更广泛的方法进行比较。
引用
@article{arxiv.2508.06951,
title = {SLRTP2025 Sign Language Production Challenge: Methodology, Results, and Future Work},
author = {Harry Walsh and Ed Fish and Ozge Mercanoglu Sincan and Mohamed Ilyes Lakhal and Richard Bowden and Neil Fox and Bencie Woll and Kepeng Wu and Zecheng Li and Weichao Zhao and Haodong Wang and Wengang Zhou and Houqiang Li and Shengeng Tang and Jiayi He and Xu Wang and Ruobei Zhang and Yaxiong Wang and Lechao Cheng and Meryem Tasyurek and Tugce Kiziltepe and Hacer Yalim Keles},
journal= {arXiv preprint arXiv:2508.06951},
year = {2025}
}
备注
11 pages, 6 Figures, CVPR conference