中文

Text Slider:基于 LoRA 适配器实现图像/视频合成的高效即插即用连续概念控制

图形学 2026-04-22 v2 人工智能 计算机视觉与模式识别 机器学习 多媒体

摘要

扩散模型的最新进展显著提升了图像与视频合成的效果。此外,已有多种概念控制方法被提出,以实现对自由格式文本提示的细粒度、连续且灵活的控制。然而,这些方法不仅需要大量的训练时间和 GPU 内存来学习滑块或嵌入,还需要针对不同的扩散主干网络进行重新训练,限制了其可扩展性与适应性。为了解决这些局限性,我们引入了 Text Slider,这是一个轻量级、高效且即插即用的框架,它在预训练的文本编码器内识别低秩方向,从而实现对视觉概念的连续控制,同时显著减少了训练时间、GPU 内存消耗以及可训练参数的数量。此外,Text Slider 支持多概念组合与连续控制,能够在图像和视频合成中实现细粒度且灵活的操控。我们表明,Text Slider 能够在保留输入原始空间布局与结构的同时,对特定属性进行平滑且连续的调制。Text Slider 实现了显著更高的效率:训练速度比 Concept Slider 快 5 倍,比 Attribute Control 快 47 倍,同时分别将 GPU 内存使用量减少了近 2 倍和 4 倍。

关键词

引用

@article{arxiv.2509.18831,
  title  = {Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA Adapters},
  author = {Pin-Yen Chiu and I-Sheng Fang and Jun-Cheng Chen},
  journal= {arXiv preprint arXiv:2509.18831},
  year   = {2026}
}

备注

Accepted by WACV 2026. We provide more experimental results on the train-free version of our algorithm. Project page: https://textslider.github.io/ Code: https://github.com/aiiu-lab/TextSlider