印度手语字母、数字和单词的生成
计算机视觉与模式识别
2025-08-14 v1 人工智能
机器学习
摘要
手语包含手部动作、面部表情和身体姿势,是与听力障碍者沟通的重要方式。经过训练的手语社区能够轻松交流,但不熟悉手语的人则面临重大挑战。识别和生成是听力障碍者之间基本的沟通方法。尽管识别方面取得了进展,手语生成仍需要进一步探索。渐进式生成对抗网络(ProGAN)在生成高质量图像方面表现突出,自注意力生成对抗网络(SAGAN)在中等分辨率下生成富有特征的图像方面也表现出色。在分辨率和细节之间取得平衡对于手语图像生成至关重要。我们正在开发一种结合两种模型的生成对抗网络(GAN)变体,用于生成具有丰富特征、高分辨率且具有类别条件的手语图像。我们的修改注意力模型在生成印度手语字母、数字和单词的高质量图像方面优于传统 ProGAN,在Inception Score (IS) 和Fréchet Inception Distance (FID) 方面分别提高了3.2和30.12。此外,我们正在发布一个大型数据集,包含印度手语字母、数字和129个单词的高质量图像。
引用
@article{arxiv.2508.09522,
title = {Generation of Indian Sign Language Letters, Numbers, and Words},
author = {Ajeet Kumar Yadav and Nishant Kumar and Rathna G N},
journal= {arXiv preprint arXiv:2508.09522},
year = {2025}
}
备注
6 pages, 5 figures, 2024 International Conference on Intelligent Algorithms for Computational Intelligence Systems (IACIS)