中文

基于对比流匹配的整体式共语气体生成语义 grounding

计算机视觉与模式识别 2026-03-30 v1

摘要

尽管共语气体生成领域取得了显著进展,但生成整体且语义 grounded 的气体仍是一个挑战。现有方法依赖外部语义检索方法,这导致其泛化能力受限,由于依赖于预定义的语言规则。基于流匹配的方法取得了有前景的效果;然而,网络仅使用与语义相符的样本进行优化,未接触负面样本,这导致学习节奏性的气体,而非稀疏运动,如象征性和隐喻性气体。此外,大多数方法以孤立的方式建模身体部位,无法保持跨模态一致性。我们引入基于对比流匹配的共语气体生成模型,使用不匹配的音频-文本条件作为负样本,训练速度场遵循正确的运动轨迹,同时驱赶语义不相符的轨迹。我们的模型通过余弦和对比目标将文本、音频和整体运动嵌入到复合潜空间,从而确保跨模态连贯性。大量实验和用户研究表明,我们的 proposed 方法在BEAT2和SHOW两个数据集上超越了最新SOTA方法。

关键词

引用

@article{arxiv.2603.26553,
  title  = {HolisticSemGes: Semantic Grounding of Holistic Co-Speech Gesture Generation with Contrastive Flow-Matching},
  author = {Lanmiao Liu and Esam Ghaleb and Aslı Özyürek and Zerrin Yumak},
  journal= {arXiv preprint arXiv:2603.26553},
  year   = {2026}
}