SignMusketeers:面向大规模手语翻译的高效多流方法
计算与语言
2025-06-04 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
手语视频处理,包括手语到文字翻译任务的挑战之一是如何以有效且高效的方式学习手语表征,同时保留这些语言的重要属性,又对无关的视觉差异保持不变性。受手语的本质和语言学性质启发,我们的 proposed 方法聚焦于手语视频中最相关的部分:手臂、面部表情和身体姿态。然而,由于现有的姿态跟踪模型在手部和面部的表现不一致,我们并不完全依赖其进行姿态估计,而是提出以自监督方式学习手语中复杂手型和面部表情的表征。我们的 approach 基于从单个帧(而非视频序列)进行学习,因此比现有手语预训练方法更高效。与在 How2Sign 数据集上取得新状态最佳成绩的最新模型相比,我们的方法在翻译性能上接近,却使用了不到 3% 的计算资源。
引用
@article{arxiv.2406.06907,
title = {SignMusketeers: An Efficient Multi-Stream Approach for Sign Language Translation at Scale},
author = {Shester Gueuwou and Xiaodan Du and Greg Shakhnarovich and Karen Livescu},
journal= {arXiv preprint arXiv:2406.06907},
year = {2025}
}
备注
Accepted to ACL (Findings) 2025