中文

IsoSignVid2Aud:无需文本中介的手势语言视频转音频

计算机视觉与模式识别 2025-10-10 v1 多媒体 声音

摘要

手势语言转 spoken 语言音频翻译对于连接听力和言语受限的人类至关重要。我们考虑带有孤立手势序列的手势语言视频,而非连续语法化手势。此类视频在教育应用和手势提示界面中有用。为此,我们提出 IsoSignVid2Aud,一个新颖的端到端框架,将包含possibly non-grammatic连续手势的手势语言视频翻译为语音,无需中间文本表示,提供即时通信优势,避免多阶段翻译系统固有的延迟和级联错误。我们的方法将I3D特征提取模块与专用特征转换网络和音频生成管道相结合,利用新颖的非最大抑制 (NMS) 算法用于非语法化连续序列中手势的时域检测。实验结果在 ASL-Citizen-1500 和 WLASL-100 数据集上表现出竞争性能,Top-1 准确率分别为 72.01% 和 78.67%,音频质量指标 (PESQ: 2.67, STOI: 0.73) 指示语音输出具有可理解性。代码可在 https://github.com/BheeshmSharma/IsoSignVid2Aud_AIMLsystems-2025 查阅。

关键词

引用

@article{arxiv.2510.07837,
  title  = {IsoSignVid2Aud: Sign Language Video to Audio Conversion without Text Intermediaries},
  author = {Harsh Kavediya and Vighnesh Nayak and Bheeshm Sharma and Balamurugan Palaniappan},
  journal= {arXiv preprint arXiv:2510.07837},
  year   = {2025}
}

备注

Accepted in AIML-Systems-2025