Sem-Lex 基准:美国手语手势及其音位建模
计算与语言
2023-10-03 v1 计算机视觉与模式识别
摘要
手语识别与翻译技术有潜力提升聋人手语社群的可及性与包容性,但研究进展受限于缺乏代表性数据。我们引入一种用于美国手语(ASL)建模的新资源——Sem-Lex Benchmark。该基准是当前同类中规模最大的,包含来自知情同意并获得报酬的聋人 ASL 手语者的超过 84k 条孤立手势视频。人类专家将这些视频与 ASL-LEX、SignBank 和 ASL Citizen 等其他手语资源对齐,从而支持手势与音系特征识别的有用扩展。我们提出一系列利用 ASL-LEX 中语言信息的实验,评估 Sem-Lex Benchmark 在孤立手势识别(ISR)上的实用性与公平性。我们使用 SL-GCN 模型表明音系特征可以 85% 的准确率被识别,且它们作为 ISR 的辅助目标是有效的。在学习识别音系特征的同时学习 gloss,使少样本 ISR 准确率提升 6%,ISR 总体准确率提升 2%。数据下载说明见 https://github.com/leekezar/SemLex。
引用
@article{arxiv.2310.00196,
title = {The Sem-Lex Benchmark: Modeling ASL Signs and Their Phonemes},
author = {Lee Kezar and Elana Pontecorvo and Adele Daniels and Connor Baer and Ruth Ferster and Lauren Berger and Jesse Thomason and Zed Sevcikova Sehyr and Naomi Caselli},
journal= {arXiv preprint arXiv:2310.00196},
year = {2023}
}
备注
In Proceedings of the ACM Conference on Accessibility (ASSETS) 2023