中文

EvalTalker: 学习评估真实肖像驱动的多主体说话人

计算机视觉与模式识别 2025-12-02 v1

摘要

语音驱动的说话人(TH)生成,俗称"说话人",目前在多主体驱动能力方面存在局限。将这一范式扩展至能够同时驱动多个主体的"多说话人",在音视频通信中引入了更丰富的交互性和更强的沉浸感。然而,现有的多说话人仍然表现出因技术局限导致的明显质量下降,导致次优的用户体验。为应对这一挑战,我们构建了THQA-MT——首个大规模多说话人生成的说话人质量评估数据集,包含来自15个代表性多说话人使用400个在线收集的真实肖像生成的5492个多说话人生成的TH(MTH)。通过主观实验,我们分析了不同多说话人之间的感知差异,并识别出12种常见的失真类型。此外,我们引入了EvalTalker,一个新颖的TH质量评估框架。该框架具备感知全局质量、人类特征和身份一致性的能力,同时整合Qwen-Sync来感知多模态同步性。实验结果表明EvalTalker与主观分数取得了优异的相关性,为未来高质量多说话人生成与评估研究提供了坚实基础。

关键词

引用

@article{arxiv.2512.01340,
  title  = {EvalTalker: Learning to Evaluate Real-Portrait-Driven Multi-Subject Talking Humans},
  author = {Yingjie Zhou and Xilei Zhu and Siyu Ren and Ziyi Zhao and Ziwen Wang and Farong Wen and Yu Zhou and Jiezhang Cao and Xiongkuo Min and Fengjiao Chen and Xiaoyu Li and Xuezhi Cao and Guangtao Zhai and Xiaohong Liu},
  journal= {arXiv preprint arXiv:2512.01340},
  year   = {2025}
}