基于运动的图检索的语气手势视频生成
计算机视觉与模式识别
2025-12-03 v1
摘要
合成同步且自然的语气手势视频仍然是一个巨大的挑战。最近的做法利用运动图谱来发掘现有视频数据的潜能。为从图中检索合适的轨迹,先前的方法要么利用从输入音频提取的特征与图中与之相关的运动特征之间的距离,要么将输入音频和运动嵌入到共享特征空间中。然而,这些技术可能并非最优,因为音频与手势之间存在许多对多映射关系,这无法通过一对一映射得到充分解决。为缓解此限制,我们提出一种新框架,首先采用扩散模型生成手势运动。扩散模型隐式地学习音频和运动的联合分布,使我们能够从输入音频序列中生成情境上恰当的手势。此外,我们的方法从输入音频中提取低层次和高层次特征,以丰富扩散模型的训练过程。随后,应用精心设计的运动基于检索算法,在评估运动的全局相似性和局部相似性后,识别图中最合适的路径。鉴于检索到的路径中并非所有节点都是顺序连续的,最终步骤涉及将这些片段无缝拼接以产生连贯的视频输出。实验结果 substantiate 我们提出的方法的有效性,证明相较于先前方法,在同步准确性和生成手势的自然性方面实现了显著的改进。
引用
@article{arxiv.2512.02576,
title = {Co-speech Gesture Video Generation via Motion-Based Graph Retrieval},
author = {Yafei Song and Peng Zhang and Bang Zhang},
journal= {arXiv preprint arXiv:2512.02576},
year = {2025}
}