中文

Ex-Omni:面向 Omni 模态大语言模型的 3D 面部动画生成

计算机视觉与模式识别 2026-02-10 v1 人工智能 计算与语言

摘要

Omni 模态大语言模型 (OLLM) 旨在统一多模态理解与生成,但尽管语音与 3D 面部动画的融合对于自然交互至关重要,却鲜有被探索。一个关键挑战在于,LLM 中离散、token 级的语义推理与用于 3D 面部运动的稠密、细粒度时序动力学之间存在表示不匹配,这在数据有限的情况下直接建模难以优化。我们提出 Expressive Omni (Ex-Omni),一个开源的 Omni 模态框架,为 OLLM 增添语音伴随的 3D 面部动画。Ex-Omni 通过分离语义推理与时序生成来降低学习难度,利用语音单元作为时序支架,并引入统一的 token-as-query 门控融合 (TQGF) 机制实现受控语义注入。我们进一步引入 InstructEx 数据集,以促进 OLLM 融合语音伴随的 3D 面部动画。广泛的实验表明,Ex-Omni 在现有开源 OLLM 竞争力强,而且能够实现语音与面部动画的稳定对齐生成。

关键词

引用

@article{arxiv.2602.07106,
  title  = {Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models},
  author = {Haoyu Zhang and Zhipeng Li and Yiwen Guo and Tianshu Yu},
  journal= {arXiv preprint arXiv:2602.07106},
  year   = {2026}
}