中文

TAVGBench:文本到有声视频生成的基准测试

计算机视觉与模式识别 2024-04-23 v1 多媒体

摘要

文本到有声视频生成(TAVG)任务涉及基于文本描述生成带有伴随音频的视频。实现这一目标需要巧妙地对齐音频和视频元素。为支持该领域的研究,我们开发了一个全面的文本到有声视频生成基准测试(TAVGBench),包含超过170万个片段,总时长11800小时。我们提出了一种自动标注流程,确保每个有声视频的音频和视频内容都有详细描述。我们还引入了视听和谐分数(AVHScore),以定量衡量生成的音频和视频模态之间的对齐程度。此外,我们提出了一个TAVG基线模型TAVDiffusion,它使用双流潜在扩散模型为该领域的进一步研究提供了基础起点。我们通过交叉注意力和对比学习实现了音频和视频的对齐。通过在TAVGBench上进行大量实验和评估,我们证明了所提模型在传统指标和我们提出的指标下的有效性。

关键词

引用

@article{arxiv.2404.14381,
  title  = {TAVGBench: Benchmarking Text to Audible-Video Generation},
  author = {Yuxin Mao and Xuyang Shen and Jing Zhang and Zhen Qin and Jinxing Zhou and Mochu Xiang and Yiran Zhong and Yuchao Dai},
  journal= {arXiv preprint arXiv:2404.14381},
  year   = {2024}
}

备注

Technical Report. Project page:https://github.com/OpenNLPLab/TAVGBench