中文

GDPO-听者:基于自回归流匹配与群奖励解耦策略优化的表达性交互式头部生成

计算机视觉与模式识别 2026-03-27 v1

摘要

为 dyadic 互动生成逼真的 3D 头部运动是虚拟人类合成中的重要挑战. 虽然 recent 方法在说话头部方面取得了令人瞩目的成果,但频繁出现 listener 动作"回归到均值"问题,导致面部僵硬,且缺乏复杂非语言动作的 参数空间. 本文提出 GDPO-Listener,一个 novel 框架,实现高度表达的说话和听者运动生成. 首先,我们引入 Auto-Regressive Flow Matching 架构实现稳定的监督学习. 为克服运动僵硬,我们应用 Group reward-Decoupled Policy Optimization (GDPO). 通过在不同 FLAME 参数组之间隔离奖励归一化,GDPO 明确激励高方差表达生成. 最后,我们实现语义文本的显式控制,以实现可定制的响应. 大规模评估表明,在Seamless Interaction 和 DualTalk 数据集上,GDPO-Listener 在长期运动方差、视觉表达性和语义可控性方面显著优于现有基线.

关键词

引用

@article{arxiv.2603.25020,
  title  = {GDPO-Listener: Expressive Interactive Head Generation via Auto-Regressive Flow Matching and Group reward-Decoupled Policy Optimization},
  author = {Zhangyu Jin and Maksim Siniukov and Deuksin Kwon and Ashutosh Chaubey and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:2603.25020},
  year   = {2026}
}