SCOPE:基于 LLM 嵌入的手语语境处理
计算机视觉与模式识别
2024-09-04 v1 人工智能
计算与语言
摘要
手语是一种视觉语言,全球约有 7000 万听障人群使用。当前基于视觉的方法在手语识别(SLR)和翻译(SLT)中在对话场景中表现不佳,主要是数据集多样性有限且忽视了与语境相关的信息。为此,我们提出 SCOPE(Sign language Contextual Processing with Embedding from LLMs),一种新型的上下文感知视觉手语识别和翻译框架。对于 SLR,我们通过多模态编码器利用对话语境来增强词汇级别的识别。随后对于 SLT,我们进一步微调大语言模型(LLM),以整合先前的对话语境。我们还贡献了一个新的手语数据集,包含 72 小时中文手语视频,涵盖多种情景下的对话场景。实验结果表明,SCOPE 框架在多个数据集上实现了最先进的性能,包括 Phoenix-2014T、CSL-Daily 以及我们的 SCOPE 数据集。此外,我们对来自听障社区的受访者进行的调查进一步验证了该方法在实际应用中的鲁棒性和有效性。我们的数据集和代码将开源,以促进进一步的研究。
引用
@article{arxiv.2409.01073,
title = {SCOPE: Sign Language Contextual Processing with Embedding from LLMs},
author = {Yuqi Liu and Wenqian Zhang and Sihan Ren and Chengyu Huang and Jingyi Yu and Lan Xu},
journal= {arXiv preprint arXiv:2409.01073},
year = {2024}
}