基于 LoRA 权重基的视觉类比空间覆盖
计算机视觉与模式识别
2026-02-18 v1 人工智能
图形学
机器学习
图像与视频处理
摘要
视觉类比学习通过演示而非文本描述实现图像变换,允许用户指定难以用文字表达的复杂变换。给定三元组 , , ,目标是生成 使得 。最近的方法仅使用单个低秩适配(LoRA)模块来适配文本到图像模型,但面临根本性限制:试图在固定适配模块中捕获多样化的视觉变换空间限制了泛化能力。鼓舞于最近的工作表明,受约束域中的 LoRA 在受约束域中张量有意义、可插值语义空间的观察,我们提出了 LoRWeB(LoRA Basis for Visual Analogy),该方法通过动态组合所学变换原语在推理时为每个类比任务专业化模型, informally,选择“LoRA 空间”中的一个点。我们引入两个关键组件:(1)一个可学习的 LoRA 模块基,来张量不同的视觉变换,以及(2)一个轻量级编码器,基于输入类比对动态选择和加权这些基 LoRA。全面评估表明,我们的方法实现了最先进的性能,并显著提高了对未见视觉变换的泛化能力。我们的发现表明,LoRA 基分解是灵活视觉操作的有前景的方向。代码和数据在 https://research.nvidia.com/labs/par/lorweb 上。
引用
@article{arxiv.2602.15727,
title = {Spanning the Visual Analogy Space with a Weight Basis of LoRAs},
author = {Hila Manor and Rinon Gal and Haggai Maron and Tomer Michaeli and Gal Chechik},
journal= {arXiv preprint arXiv:2602.15727},
year = {2026}
}
备注
Code and data are in https://research.nvidia.com/labs/par/lorweb