面向实时手语生成的自回归-扩散混合模型
计算机视觉与模式识别
2025-09-19 v3
摘要
早期的手语生成模型通常依赖自回归方法逐个生成输出标记,这本质上提供了时间对齐。尽管 Teacher Forcing 可防止训练期间模型崩溃,但仍无法解决推理阶段误差累积问题,因为此时没有 ground truth。相比之下,基于扩散模型的更新方法利用逐步去噪实现高质量生成。然而,这些模型的迭代性质以及要求对整个序列去噪的限制,使其在此类实时任务中不具可行性。为此,我们探索一种结合自回归和扩散模型的混合方法,利用两者在序列依赖建模和输出细化方面的优势。为捕捉细粒度身体动作,我们设计了多尺度姿态表示模块,分别提取不同关节部位的详细特征,并通过多尺度融合模块整合。进一步,我们引入置信感知因果注意力机制,利用关节级别的置信度分数动态引导姿态生成过程,提高准确性和鲁棒性。在 PHOENIX14T 和 How2Sign 数据集上的大量实验表明,我们的方法在生成质量和实时效率方面均表现出色。
引用
@article{arxiv.2507.09105,
title = {Hybrid Autoregressive-Diffusion Model for Real-Time Sign Language Production},
author = {Maoxiao Ye and Xinfeng Ye and Mano Manoharan},
journal= {arXiv preprint arXiv:2507.09105},
year = {2025}
}