中文

JoyHallo: 满足语种的数字人模型

计算机视觉与模式识别 2024-09-23 v1

摘要

在音频驱动视频生成中, 创建满语种视频 presents significant 挑战。收集完整的满语种数据集困难, 满语种中复杂的唇形动作进一步使模型训练比英语复杂。本研究收集了来自京东健康国际公司员工的 29 小时满语种语音视频, 形成 jdh-Hallo 数据集。该数据集涵盖多样年龄和说话风格, 包括对话和专业医学主题。为适配 JoyHallo 模型处理满语种, 我们采用中文 wav2vec2 模型进行音频特征嵌入。提出一种半解耦结构以捕获唇部、表情和姿态特征之间的特征关系。这种集成不仅提高了信息利用效率, 还通过 14.3% 加速推理速度。值得注意的是, JoyHallo 保持其强大的英语视频生成能力, 显示出卓越的跨语言生成能力。代码和模型均可在 https://jdh-algo.github.io/JoyHallo 获取。

关键词

引用

@article{arxiv.2409.13268,
  title  = {JoyHallo: Digital human model for Mandarin},
  author = {Sheng Shi and Xuyang Cao and Jun Zhao and Guoxin Wang},
  journal= {arXiv preprint arXiv:2409.13268},
  year   = {2024}
}