中文

FreeSliders:面向图像、音频和视频的训练免费、模态无关的概念滑块

计算机视觉与模式识别 2025-11-04 v1 人工智能

摘要

扩散模型已成为图像、音频和视频生成领域的前沿生成模型,但实现细粒度可控生成——即在不干扰无关内容的前提下持续引导特定概念——仍然具有挑战性。概念滑块(CS)通过文本对话发现语义方向,为可行的方向提供了希望,但需要为每个概念进行训练和特定于架构的微调(例如 LoRA),限制了其对新模态的可扩展性。本文我们介绍 FreeSliders,一种完全训练免费且模态无关的方法,通过在推理期间部分估计 CS 公式来实现。为支持模态无关的评估,我们扩展了 CS 框架,包括视频和音频,建立了第一个用于多模态细粒度概念生成控制的套件。我们进一步提出了三个评估属性并引入新的指标以提高评估质量。最后,我们识别了一个规模选择和非线性遍历的开放问题,提出了一个两阶段程序,用于自动检测饱和点并重新参数化遍历,以实现感知上均匀、在语义上有意义的编辑。广泛的实验表明,我们的方法实现了跨模态的即插即用、训练免费的概念控制,优于现有基线方法,并为原则可控生成建立了新工具。我们的基准和方法的交互式演示可在:https://azencot-group.github.io/FreeSliders/ 查看。

关键词

引用

@article{arxiv.2511.00103,
  title  = {FreeSliders: Training-Free, Modality-Agnostic Concept Sliders for Fine-Grained Diffusion Control in Images, Audio, and Video},
  author = {Rotem Ezra and Hedi Zisling and Nimrod Berman and Ilan Naiman and Alexey Gorkor and Liran Nochumsohn and Eliya Nachmani and Omri Azencot},
  journal= {arXiv preprint arXiv:2511.00103},
  year   = {2025}
}