LASER: 面向文本条件图像到动画的无调优LLM驱动注意力控制
计算机视觉与模式识别
2025-03-25 v3
摘要
革命性的文本到图像模型进展开启了新的维度用于精细内容创建,如文本条件图像编辑,使现有图像能够根据文本指导进行修改。这种能力允许生成各种传达复杂视觉概念的图像。然而,现有方法主要聚焦于从文本-图像对生成新图像,难以在无微调的情况下从现有图像和文本指导中生成细粒度动画。在本文中,我们引入了LASER,这是一种无调优的LLM驱动注意力控制框架,遵循渐进的过程:LLM规划、特征-注意力注入和稳定动画生成。LASER利用大语言模型(LLM)将概括描述细化为精细的提示,引导预训练的文本到图像模型生成与细微变化相对应的关键帧。LLM还为特征和注意力注入生成控制信号,从而在无需额外微调的情况下实现各种转换的无缝文本引导图像形变。通过使用来自输入图像的相同初始噪声反转,LASER在去噪期间接收LLM控制的注入,并利用插值文本嵌入生成一系列连贯的动画帧。我们提出了文本条件图像到动画基准测试,以验证LASER的有效性和效益。大量实验表明,LASER在一致且高效的动画生成方面取得令人印象深刻的结果,确立了其作为生产详细动画的强大工具,并为数字内容创建开辟了新的前沿。
引用
@article{arxiv.2404.13558,
title = {LASER: Tuning-Free LLM-Driven Attention Control for Efficient Text-conditioned Image-to-Animation},
author = {Haoyu Zheng and Wenqiao Zhang and Yaoke Wang and Juncheng Li and Zheqi Lv and Xin Min and Mengze Li and Dongping Zhang and Siliang Tang and Yueting Zhuang},
journal= {arXiv preprint arXiv:2404.13558},
year = {2025}
}