基于多阶段序列标注的伴语手势检测
计算机视觉与模式识别
2024-04-30 v2
摘要
手势是面对面交流的组成部分。它们随时间展开,通常遵循可预测的准备、 stroke(核心动作)和收回等运动阶段。然而,主流的自动手势检测方法将问题视为二分类,把片段分类为含手势或不含手势,因而未能捕捉其固有的序列与上下文本质。为此,我们引入一种新框架,将任务重新定义为多阶段序列标注问题而非二分类。我们的模型处理时间窗口内的骨骼运动序列,使用 Transformer 编码器学习上下文嵌入,并利用条件随机场执行序列标注。我们在一个包含任务导向面对面对话中多样伴语手势的大规模数据集上评估了我们的方案。结果一致表明,我们的方法在检测手势 stroke 方面显著优于强基线模型。此外,应用 Transformer 编码器从运动序列学习上下文嵌入显著改进了手势单元检测。这些结果凸显了我们的框架捕捉伴语手势阶段细粒度动态的能力,为更精细准确的手势检测与分析铺平了道路。
引用
@article{arxiv.2308.10680,
title = {Co-Speech Gesture Detection through Multi-Phase Sequence Labeling},
author = {Esam Ghaleb and Ilya Burenko and Marlou Rasenberg and Wim Pouw and Peter Uhrig and Judith Holler and Ivan Toni and Aslı Özyürek and Raquel Fernández},
journal= {arXiv preprint arXiv:2308.10680},
year = {2024}
}