GimmBO:基于贝叶斯优化的交互式生成式图像模型合并
计算机视觉与模式识别
2026-01-27 v1 图形学
摘要
基于微调的适配被广泛用于定制基于扩散的图像生成,这导致了大量捕获多样主题和风格的社区创建适配器集合。源自同一基础模型的适配器可以通过权重进行合并,从而在广阔且连续的设计空间内合成新的视觉结果。为了探索这一空间,当前的工作流依赖于基于滑块的手动调整,这种方法扩展性差且使得权重选择变得困难,即使候选集仅限于20-30个适配器。我们提出GimmBO,通过偏好贝叶斯优化(PBO)支持图像生成中适配器合并的交互式探索。基于对真实世界使用情况的观察(包括稀疏性和受限的权重范围),我们引入了一个两阶段BO后端,提高了高维空间中的采样效率和收敛性。我们通过模拟用户和一项用户研究评估了该方法,展示了其改善的收敛性、高成功率以及相对于BO和线搜索基线的一致增益,并进一步通过若干扩展展示了该框架的灵活性。
引用
@article{arxiv.2601.18585,
title = {GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization},
author = {Chenxi Liu and Selena Ling and Alec Jacobson},
journal= {arXiv preprint arXiv:2601.18585},
year = {2026}
}