SkelCap:从骨架关键点序列自动生成描述性文本
计算机视觉与模式识别
2024-07-24 v1 机器学习
摘要
存在大量手语数据集,但它们通常只涵盖全球使用的数千种手语中的有限选择。此外,由于收集不同手语者的成本,创建多样化的手语数据集是一项昂贵且具有挑战性的任务。受这些挑战的启发,我们旨在开发一种解决这些局限性的方案。在此背景下,我们专注于从骨架关键点序列文本描述身体运动,从而创建了一个新数据集。我们围绕AUTSL(一个全面的孤立土耳其手语数据集)构建了该数据集。我们还开发了一个基线模型SkelCap,它可以生成身体运动的文本描述。该模型将骨架关键点数据作为向量处理,应用全连接层进行嵌入,并利用Transformer神经网络进行序列到序列建模。我们对模型进行了广泛评估,包括手语者无关和手语无关评估。该模型取得了有希望的结果,在手语者无关评估中ROUGE-L得分为0.98,BLEU-4得分为0.94。我们准备的数据集AUTSL-SkelCap将很快公开发布。
引用
@article{arxiv.2405.02977,
title = {SkelCap: Automated Generation of Descriptive Text from Skeleton Keypoint Sequences},
author = {Ali Emre Keskin and Hacer Yalim Keles},
journal= {arXiv preprint arXiv:2405.02977},
year = {2024}
}
备注
8 pages, 5 figures, 7 tables, submitted to IEEE conference