中文

ATRIE:面向人格驱动语音合成的自适应调谐以实现稳健的推理与情感

声音 2026-04-24 v2

摘要

高保真人物语音合成是沉浸式多媒体应用的基石,尤其是与动漫角色和数字人交互。然而,现有系统在不同情感情境下难以保持一致的人格特征。为弥合这一差距,我们提出 ATRIE,一个统一的框架,利用人格-韵律双轨架构(Persona-Prosody Dual-Track, P2-DT)进行实现。我们的系统通过标量量化实现静态 Timbre 轨道,通过层次流匹配实现动态韵律轨道,蒸馏自 14B LLM 教师。该设计实现了鲁棒的身份保持(零-shot Speaker Verification EER: 0.04)和丰富的情感表达。评估于我们扩展的 AnimeTTS-Bench(50 个角色)期间,ATRIE 在生成和跨模态检索方面实现了最佳性能(mAP: 0.75),确立了人格驱动多媒体内容创建的新范式。

引用

@article{arxiv.2604.19055,
  title  = {ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis},
  author = {Aoduo Li and Haoran Lv and Hongjian Xu and Shengmin Li and Sihao Qin and Zimeng Li and Chi Man Pun and Xuhang Chen},
  journal= {arXiv preprint arXiv:2604.19055},
  year   = {2026}
}

备注

10 pages, 6 figures. Accepted to ACM ICMR 2026