中文

SemTalk:基于帧级语义强调的整体协语动作生成

计算机视觉与模式识别 2025-03-12 v3

摘要

协语动作生成若不细致地集成常规节奏动作与少数却至关重要的语义动作,难以实现良好效果。本文提出 SemTalk,用于实现具备帧级语义强调的整体协语动作生成。我们的关键洞察是分别学习基准动作和稀疏动作,然后进行自适应融合。具体而言,探索了粗到细交叉注意力模块和节奏一致性学习,以建立与节奏相关的基准动作,确保与语音节奏同步的连贯基础。随后,设计了语义强化学习,以生成针对帧级语义线索的稀疏动作。最后,为将稀疏动作融入基准动作并生成语义强化的协语手势,我们进一步利用所学习的语义得分进行自适应合成。在两个公开数据集上的定性和定量比较表明,我们的方法在语义丰富性方面优于最新技术,同时保持稳定的基准动作。

关键词

引用

@article{arxiv.2412.16563,
  title  = {SemTalk: Holistic Co-speech Motion Generation with Frame-level Semantic Emphasis},
  author = {Xiangyue Zhang and Jianfang Li and Jiaxu Zhang and Ziqiang Dang and Jianqiang Ren and Liefeng Bo and Zhigang Tu},
  journal= {arXiv preprint arXiv:2412.16563},
  year   = {2025}
}

备注

11 pages, 8 figures