A$^2$-LLM:面向 end-to-end 对话音频化身的大语言模型
机器学习
2026-02-06 v1 人工智能
声音
摘要
开发具表达性和响应性的对话式数字人是下一代人机交互的基石。虽然大型语言模型(LLM)显著提升了对话能力,但当前大多数系统仍依赖连接独立模块的级联式架构。这类管道常受累积错误、高延迟和差异实时性能的困扰。缺乏对底层对话上下文的访问,这些管道本质上优先考虑刚性唇同步而非情感深度。为此,我们提出 A-LLM,一种在统一框架内联合推理语言、音频韵律和 3D 面部运动的 end-to-end 对话音频化身大语言模型。为便于训练,我们引入 FLAME-QA,一套高质量的多模态数据集,旨在将语义意图与富有表现力的面部动态相匹配并以 QA 格式呈现。凭借深层语义理解,A-LLM 可生成超越简单唇同步的情感丰富面部动作。实验结果表明,我们的系统在保持实时效率(500 毫秒延迟,0.7 倍_rtf)的同时,实现了卓越的情感表达能力。
引用
@article{arxiv.2602.04913,
title = {A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model},
author = {Xiaolin Hu and Hang Yuan and Xinzhu Sang and Binbin Yan and Zhou Yu and Cong Huang and Kai Chen},
journal= {arXiv preprint arXiv:2602.04913},
year = {2026}
}
备注
13 pages, 3 figures