中文

从在线视频中学得的开放域手语翻译

计算机视觉与模式识别 2022-11-22 v2 计算与语言

摘要

现有关于手语翻译(即,从手语视频翻译为书面语言句子)的工作主要集中于(1)在受控环境中收集的数据或(2)特定领域的数据,这限制了对真实世界场景的适用性。本文中,我们引入 OpenASL,一个从在线视频网站(如 YouTube)收集的大规模美国手语(ASL)-英语数据集。OpenASL 包含来自 200 多名手语使用者的多领域 288 小时 ASL 视频,是迄今最大公开可用的 ASL 翻译数据集。为应对真实场景且无注释符号的手语翻译挑战,我们提出一组技术,包括以手语搜索作为预训练的前置任务,以及口型与手形特征的融合。所提技术相较基于先前工作的基线模型,在翻译质量上带来一致且大幅的提升。我们的数据与代码公开于 https://github.com/chevalierNoir/OpenASL

关键词

引用

@article{arxiv.2205.12870,
  title  = {Open-Domain Sign Language Translation Learned from Online Video},
  author = {Bowen Shi and Diane Brentari and Greg Shakhnarovich and Karen Livescu},
  journal= {arXiv preprint arXiv:2205.12870},
  year   = {2022}
}

备注

EMNLP 2022