基于LoRA的少样本多Token DreamBooth风格一致角色生成
计算机视觉与模式识别
2026-01-26 v1 机器学习
摘要
视听行业正在经历深刻转型,正将AI发展整合进来,不仅以自动化常规任务,还以激发新的艺术形式。本文解决了一个问题:生成数量几乎无限的新型角色,同时保留少量人工设计参考角色的艺术风格和共享视觉特征,从而拓宽动画、游戏及相关领域的创作可能性。我们的方案建立在DreamBooth——一种用于文本到图像扩散模型的成熟微调技术——之上,并针对两个核心挑战进行了适配:捕捉超出文本提示的复杂角色细节以及训练数据的少样本特性。为此,我们提出一种多Token策略,利用聚类为单个角色及其集体风格分配独立Token,并结合基于LoRA的参数高效微调。通过移除类别特定正则化集并在生成过程中引入随机Token和嵌入,我们的方法允许无限角色创建同时保留已学到的风格。我们在五个小型专用数据集上评估了该方法,将其与相关基线通过定量指标和人类评估研究进行比较。结果表明,我们的方法在保留参考角色独特美学特征的同时生成了高质量、多样化的角色,人类评估进一步验证了其有效性并突显了我们方法的潜力。
引用
@article{arxiv.2510.09475,
title = {Few-shot multi-token DreamBooth with LoRa for style-consistent character generation},
author = {Ruben Pascual and Mikel Sesma-Sara and Aranzazu Jurio and Daniel Paternain and Mikel Galar},
journal= {arXiv preprint arXiv:2510.09475},
year = {2026}
}