情境手势:基于情境感知手势表示的协语义手势视频生成
计算机视觉与模式识别
2025-09-23 v3 人工智能
摘要
协语义手势生成对于创建逼真的化身并通过同步手势与语音增强人机交互至关重要。尽管近期取得了进展,但现有方法在准确识别语音的节奏或语义触发器以生成情境化手势模式方面仍面临挑战,难以实现像素级的真实感。为此本文提出Contextual Gesture框架,通过三个创新组件改进协语义手势视频生成:(1)语音-手势时间顺序对齐,将两种模态在时间上连接起来,(2)情境化手势标记化通过蒸馏将语音情境纳入运动模式表示,(3)结构感知细化模块采用边缘连接将手势关键点链接起来,以提高视频生成质量。我们的广泛实验表明,Contextual Gesture不仅产生逼真且语音对齐的手势视频,而且支持长序列生成和视频手势编辑应用,见图1。
引用
@article{arxiv.2502.07239,
title = {Contextual Gesture: Co-Speech Gesture Video Generation through Context-aware Gesture Representation},
author = {Pinxin Liu and Pengfei Zhang and Hyeongwoo Kim and Pablo Garrido and Ari Shapiro and Kyle Olszewski},
journal= {arXiv preprint arXiv:2502.07239},
year = {2025}
}
备注
Accepted to ACM MM 2025. Project Page: https://andypinxinliu.github.io/Contextual-Gesture/