中文

Gelina:基于交错标记预测的统一语音与手势合成框架

声音 2026-04-29 v4 人工智能 音频与语音处理

摘要

人类沟通是多模态的,语音与手势紧密耦合,但大多数计算方法是顺序合成语音与手势,导致同步性和韵律对齐受损。我们提出 Gelina,一个统一框架,通过离散自回归主干网络中的交错标记序列联合合成语音与配语手势,采用模态特定解码器。Gelina 支持多说话人和多风格克隆,并可从语音输入生成手势。主观评估和客观评估表明,Gelina 在语音质量和手势生成方面均优于单模态基线。

关键词

引用

@article{arxiv.2510.12834,
  title  = {Gelina: Unified Speech and Gesture Synthesis via Interleaved Token Prediction},
  author = {Téo Guichoux and Théodor Lemerle and Shivam Mehta and Jonas Beskow and Gustav Eje Henter and Laure Soulier and Catherine Pelachaud and Nicolas Obin},
  journal= {arXiv preprint arXiv:2510.12834},
  year   = {2026}
}

备注

Paper accepted at ICASSP 2026, 5 pages