HOP:基于异构拓扑的多模态纠缠用于协同语气手势生成
计算机视觉与模式识别
2025-03-04 v1 多媒体
摘要
协同语气手势是人类沟通中增强语音清晰度和表达性的关键非语言线索,已引起多模态研究中的广泛关注。虽然现有方法在手势精度方面取得了进展,但在生成多样且连贯的手势方面仍面临挑战,因为大多数方法假设多模态输入之间是独立的,缺乏对其相互作用的显式建模。本文提出了一种名为 HOP 的新型多模态学习方法,用于协同语气手势生成,通过捕捉手势运动、音频节奏和文本语义之间的异构纠缠,实现手势的协调生成。通过利用时空图建模,我们实现了音频与动作的对齐。此外,为增强模态间的一致性,我们基于重新编程模块构建了音频-文本语义表示,这有助于跨模态适应。我们的做法使多模态系统能够相互学习彼此的特征,并以拓扑纠缠形式表示。大量实验表明,HOP 实现了最新的性能,生成更自然、更具表达性的协同语气手势。更多信息、代码和演示可在此处找到:https://star-uu-wang.github.io/HOP/
引用
@article{arxiv.2503.01175,
title = {HOP: Heterogeneous Topology-based Multimodal Entanglement for Co-Speech Gesture Generation},
author = {Hongye Cheng and Tianyu Wang and Guangsi Shi and Zexing Zhao and Yanwei Fu},
journal= {arXiv preprint arXiv:2503.01175},
year = {2025}
}
备注
Accepted by CVPR 2025. See https://star-uu-wang.github.io/HOP/