JWB-DH-V1:联合全身说话虚拟人与语音生成基准测试版本 1
计算机视觉与模式识别
2025-07-30 v2 人工智能
摘要
近期基于扩散的视频生成进展已能实现逼真的短视频片段,但当前方法在联合生成全身运动与自然语音时仍难以实现多模态一致性。现有方法缺乏同时评估视觉与音频质量的综合评估框架,且针对特定区域性能分析的基准测试不足。为填补这些空白,我们引入了联合全身说话虚拟人与语音生成版本 1(JWB-DH-V1),包含一个包含 10,000 个独特身份、200 万视频样本的大规模多模态数据集,以及一个用于评估全身可动画虚拟人音视频联合生成的评估协议。我们对 SOTA 模型的评估揭示了以面部/手部为中心的性能与全身性能之间存在持续差异,这指明了未来研究的关键领域。数据集与评估工具已在 https://github.com/deepreasonings/WholeBodyBenchmark 公开。
引用
@article{arxiv.2507.20987,
title = {JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1},
author = {Xinhan Di and Kristin Qi and Pengqian Yu},
journal= {arXiv preprint arXiv:2507.20987},
year = {2025}
}
备注
WiCV @ ICCV 2025