中文

ANIM-400K:用于视频自动端到端配音的大规模数据集

音频与语音处理 2024-01-11 v1 计算与语言 计算机视觉与模式识别 声音

摘要

互联网拥有丰富的内容,其中高达 60% 以英语发布,这与全球人口形成鲜明对比,全球仅有 18.8% 的人口讲英语,且只有 5.1% 的人将其视为母语,从而导致在线信息获取的不平等。不幸的是,视频配音的自动化流程——用翻译后的音轨替换视频的原始音轨——仍然是一项复杂且具有挑战性的任务,因为其流程需要精确的时间控制、面部动作同步和韵律匹配。虽然端到端配音提供了一种解决方案,但数据稀缺继续阻碍着端到端和基于流程的方法的进展。在这项工作中,我们推出了 Anim-400K,这是一个包含超过 42.5 万个对齐的日语和英语动画视频片段的综合数据集,支持各种视频相关任务,包括自动配音、同声传译、引导式视频摘要以及流派/主题/风格分类。我们的数据集已公开供研究使用,网址为 https://github.com/davidmchan/Anim400K。

关键词

引用

@article{arxiv.2401.05314,
  title  = {ANIM-400K: A Large-Scale Dataset for Automated End-To-End Dubbing of Video},
  author = {Kevin Cai and Chonghua Liu and David M. Chan},
  journal= {arXiv preprint arXiv:2401.05314},
  year   = {2024}
}

备注

To appear in ICASSP 2024