中文

RichSpace:通过文本嵌入插值丰富文本到视频提示空间

计算机视觉与模式识别 2025-02-04 v2 人工智能 计算与语言 机器学习

摘要

文本到视频生成模型取得了显著进展,但仍在生成具有复杂特征的视频方面存在困难。这一限制常常源于文本编码器无法产生准确的嵌入,从而阻碍视频生成模型。为此,我们提出了一种新方法,通过在嵌入空间中进行插值来选择最佳文本嵌入。我们展示了这一方法使视频生成模型能够生成所需的视频。此外,我们引入了一个简单算法,使用垂直脚嵌入和余弦相似度来识别最佳插值嵌入。我们的发现突显了准确文本嵌入的重要性,并为改进文本到视频生成性能提供了一条途径。

关键词

引用

@article{arxiv.2501.09982,
  title  = {RichSpace: Enriching Text-to-Video Prompt Space via Text Embedding Interpolation},
  author = {Yuefan Cao and Chengyue Gong and Xiaoyu Li and Yingyu Liang and Zhizhou Sha and Zhenmei Shi and Zhao Song},
  journal= {arXiv preprint arXiv:2501.09982},
  year   = {2025}
}