失落的旋律:从叙事视角看文本到视频生成的经验观察
计算机视觉与模式识别
2024-05-15 v1
摘要
文本到视频生成任务取得了显著进展,其生成结果能以高保真度和令人印象深刻的视觉质量反映文本提示。然而,当前的文本到视频生成模型无一例外地专注于传达单一场景的视觉元素,迄今为止对这一媒介的另一重要潜力,即叙事性,漠不关心。在本文中,我们从叙事视角审视了文本到视频生成,这一视角鲜有研究,并提出了经验性评论,突显当前文本到视频生成方案的局限性。我们还提出了一个针对视频叙事层面的评估框架,并讨论了未来潜在的方向。
引用
@article{arxiv.2405.08720,
title = {The Lost Melody: Empirical Observations on Text-to-Video Generation From A Storytelling Perspective},
author = {Andrew Shin and Yusuke Mori and Kunitake Kaneko},
journal= {arXiv preprint arXiv:2405.08720},
year = {2024}
}
备注
To appear at CVPR 2024 Workshop on AI for Content Creation (AI4CC)