赋能手语沟通:整合情感与语义以实现面部表情合成
计算机视觉与模式识别
2024-08-28 v1
摘要
将口语语言的书面句子翻译为手势序列(包括手动和非手动手势)在构建更包容性社会中发挥着关键作用,尤其是对于听力丧失或听力受损的人群。其中,面部表情(非手动成分)负责编码要说的句子的语法、应用标点、代词或强调手势。这些非手动手势与要表达的句子的语义密切相关,也与说话者的情感表达有关。然而,大多数手语生产(SLP)方法都集中于合成手动手势,未能有效地建模说话者的表情。本文提出了一种新方法,专注于手语面部表情的合成。我们的目标是通过整合情感信息来提升手语生产质量。该方法利用句子情感和语义特征,从有意义的表示空间中进行采样,将非手动成分的偏差整合到手语生产过程中。为评估我们的方法,我们扩展了Frenchet Gesture Distance(FGD),并提出了新的度量指标Frenchet Expression Distance(FED),并应用了广泛的指标来评估面部特定区域的质量。实验结果表明,我们的方法在How2Sign和PHOENIX14T数据集上实现了最先进的性能,在竞争方法中取得了优势。此外,我们的体系结构基于精心设计的图形金字塔,使其更加简单、更容易训练,并且能够利用情感来产生面部表情。
引用
@article{arxiv.2408.15159,
title = {Empowering Sign Language Communication: Integrating Sentiment and Semantics for Facial Expression Synthesis},
author = {Rafael Azevedo and Thiago Coutinho and João Ferreira and Thiago Gomes and Erickson Nascimento},
journal= {arXiv preprint arXiv:2408.15159},
year = {2024}
}