ReactDiff:通用合适面部表情反应扩散模型
计算机视觉与模式识别
2025-10-07 v1 人机交互
多媒体
摘要
在二人对话中自动生成多样且符合人类常规的面部表情反应,仍是人机交互系统的关键挑战。现有方法未能建模真实人类反应中固有的随机性和动态性。为此,我们提出 ReactDiff,一个用于生成符合任何给定对话上下文的合适面部表情反应的新型时序扩散框架。我们的关键洞察是,合理的人类反应在时间上表现出平滑性、连贯性,并遵循人类面部解剖学所施加的约束。为实现这一目标,ReactDiff 将两种关键先验(时空面部运动学)纳入扩散过程:i) 时序面部行为运动学和 ii) 面部动作单元依赖性。这两种约束引导模型接近真实人类反应的流形,避免视觉上不真实的抖动、不可稳定的转换、不自然的表情及其他制件。大量实验表明,我们的方法不仅在质量上达到最先进水平,还在多样性和反应合适性方面表现卓越。
引用
@article{arxiv.2510.04712,
title = {ReactDiff: Fundamental Multiple Appropriate Facial Reaction Diffusion Model},
author = {Luo Cheng and Song Siyang and Yan Siyuan and Yu Zhen and Ge Zongyuan},
journal= {arXiv preprint arXiv:2510.04712},
year = {2025}
}
备注
Accepted to ACM Multimedia