ARIG: 基于自回归的交互式头部生成,用于实时对话
计算机视觉与模式识别
2025-07-02 v1
摘要
面对面交流是一种常见的人类活动,推动了交互式头部生成的研究。虚拟代理能够根据另一用户及自身的音频或运动信号生成带有倾听与发言能力的动作响应。然而,现有基于片段的生成范式或显式的听者/说话者生成器切换方法在获取未来信号、上下文行为理解以及切换平滑性方面存在局限,难以实现实时且真实的生成。本文提出一种基于自回归(AR)的帧级框架,称为ARIG,以实现更佳交互真实性的实时生成。为实现实时生成,我们将运动预测建模为非向量量化的AR过程。不同于离散码本索引预测,我们使用扩散程序表示运动分布,在连续空间中实现更精确的预测。为提升交互真实性,我们强调交互行为理解(IBU)和详细的对话状态理解(CSU)。在IBU中,基于双轨双模信号,我们通过双向集成学习总结短程行为,并在长程范围内进行上下文理解。在CSU中,我们利用语音活动信号和IBU的上下文特征,以理解实际对话中存在的各种状态(中断、反馈、暂停等),这些状态作为最终渐进运动预测的条件。大量实验验证了我们模型的有效性。
引用
@article{arxiv.2507.00472,
title = {ARIG: Autoregressive Interactive Head Generation for Real-time Conversations},
author = {Ying Guo and Xi Liu and Cheng Zhen and Pengfei Yan and Xiaoming Wei},
journal= {arXiv preprint arXiv:2507.00472},
year = {2025}
}
备注
ICCV 2025. Homepage: https://jinyugy21.github.io/ARIG/