视频会议中手语姿态的实时字幕
计算机视觉与模式识别
2025-07-22 v1 计算机与社会
人机交互
机器学习
摘要
与拥有听力障碍者沟通始终是一个相当困难的任务。与其使用打字方式沟通,最常用的办法是使用手语语言。然而,很少有人了解手语涉及的诸多细微之处。利用计算机视觉进行手语识别旨在消除听力残障者与普通人之间的沟通障碍,从而能够与他人妥善沟通。近期,疫情使整个世界陷入动荡,变革了我们的沟通方式。视频会议已成为每个人的必需品,即便是拥有听力障碍者也是如此。近期研究发现,拥有听力障碍者的人在这些视频会议中更倾向于使用手语而非打字。本文提出了一个浏览器扩展程序,可自动将手语翻译为字幕,供会议中其他所有人使用。本研究将使用包含超过 2000 个单词级别 ASL 视频的大规模数据集,这些视频由超过 100 位手语说话人执行。
引用
@article{arxiv.2507.14543,
title = {Real Time Captioning of Sign Language Gestures in Video Meetings},
author = {Sharanya Mukherjee and Md Hishaam Akhtar and Kannadasan R},
journal= {arXiv preprint arXiv:2507.14543},
year = {2025}
}
备注
7 pages, 2 figures, 1 table, Presented at ICCMDE 2021