中文

面向电影制作对话、叙事、独白自适应的移动配音基准

机器学习 2025-05-06 v1

摘要

电影配音取得了显著进展,但评估这些模型在现实世界中的有效性仍具有挑战性。需要一个全面的评估基准来实现这一目标,主要基于两个关键原因:1) 现有指标未能完全捕捉电影对话、叙事、独白以及演员适应性的复杂性;2) 实际的评估系统应为提高电影配音质量和电影制作进步提供有价值的见解。为此,我们引入了 Talking Adaptive Dubbing Benchmarks (TA-Dubbing),旨在通过适应对话、叙事、独白和演员来改进电影配音。TA-Dubbing 具有多个关键优势:1) 全面维度:TA-Dubbing 涵盖了电影配音的各种维度,包含关于电影理解和 speech 生成的评估指标;2) 多样化基准测试:TA-Dubbing 旨在评估最先进的电影配音模型和先进的多模态大语言模型;3) 完全开源:我们在 https://github.com/woka-0a/DeepDubber-V1 完全开源 TA-Dubbing,包括所有视频素材、评估方法和注释。我们还持续将新的电影配音模型集成到 TA-Dubbing 排行榜中 https://github.com/woka-0a/DeepDubber-V1,以推动电影配音领域的发展。

关键词

引用

@article{arxiv.2505.01450,
  title  = {Towards Film-Making Production Dialogue, Narration, Monologue Adaptive Moving Dubbing Benchmarks},
  author = {Chaoyi Wang and Junjie Zheng and Zihao Chen and Shiyu Xia and Chaofan Ding and Xiaohao Zhang and Xi Tao and Xiaoming He and Xinhan Di},
  journal= {arXiv preprint arXiv:2505.01450},
  year   = {2025}
}

备注

6 pages, 3 figures, accepted to the AI for Content Creation workshop at CVPR 2025 in Nashville, TN