通向无障碍沟通之桥:基于提示词扩散模型的精细提示语手势生成
计算机视觉与模式识别
2024-05-01 v1
摘要
提示语(CS)是一种先进的视觉语音编码系统,将唇读与手部编码相结合,使听障人士能够高效沟通。CS视频生成旨在从音频或文本输入生成CS的特定唇部和手势动作。主要挑战在于,在有限的CS数据下,我们努力同时生成精细的手部和手指动作以及唇部动作,同时这两类动作需要异步对齐。现有的CS生成方法由于基于模板的统计模型和精心手工预处理以适应模型而脆弱且性能不佳。因此,我们提出了一种新颖的基于提示词扩散的CS手势生成框架(称为GlossDiff)。具体来说,为了将额外的语言规则知识整合到模型中,我们首先引入了一个称为“Gloss”的桥接指令,它是一种自动生成的描述性文本,用于在口语和CS手势之间建立直接且更精细的语义连接。此外,我们首次提出节奏是CS中提高沟通效率的重要副语言特征。因此,我们提出了一种新颖的音频驱动节奏模块(ARM)来学习与音频语音匹配的节奏。此外,在这项工作中,我们设计、录制并发布了第一个包含四位CS提示者的中文CS数据集。大量实验表明,我们的方法在定量和定性上均优于当前最先进(SOTA)方法。我们在https://glossdiff.github.io/发布代码和数据。
引用
@article{arxiv.2404.19277,
title = {Bridge to Non-Barrier Communication: Gloss-Prompted Fine-grained Cued Speech Gesture Generation with Diffusion Model},
author = {Wentao Lei and Li Liu and Jun Wang},
journal= {arXiv preprint arXiv:2404.19277},
year = {2024}
}