中文

HyperTransport:面向 T2I 生成模型的分摊条件化技术

机器学习 2026-05-12 v1 人工智能

摘要

随着基础模型能力的提升,高效可靠地控制其行为已成为关键。微调这些模型成本高昂,而提示词虽在可操作性上实用,却因模型对提示词措辞和结构高度敏感而脆弱。这一脆弱性推动了对激活导控技术的关注,这些技术提供了更稳定可预测的控制方式。然而,现有激活导控方法需要针对每个概念进行优化,因而不适用于概念集合大、动态或仅在请求时指定的部署场景:每个新概念至少需要数分钟的目标模型优化。我们提出了 HyperTransport,一种超网络框架,通过将来自预训练编码器(CLIP 作为实例)的嵌入直接映射到干预参数来分摊此类成本,使用最优传输损失进行端到端训练。训练完成后,HyperTransport 仅需一次超网络前向传播即可生成每个干预,速度比逐概念拟合快 3600-7000 倍。在训练期未见的概念上,它能在诱导目标概念方面匹配最强的逐概念基线。通过解耦概念表征与干预预测,HyperTransport 将三项能力组合为一体,这些能力是现有方法所不具备的:面向开放式概念集合的分摊式导控、连续可解释的强度控制,以及参考图像可直接引导基于文本的生成。我们在 DMD2 和 Nitro-1-PixArt 上通过 CLIP 基于指标、VLM 评估和用户研究,对 167 个保留测试概念进行验证。在两两比较中,人类和 VLM 评判官均倾向于 HyperTransport 超过提示词约 2 倍。

关键词

引用

@article{arxiv.2605.08254,
  title  = {HyperTransport: Amortized Conditioning of T2I Generative Models},
  author = {Valentino Maiorca and Eleonora Gualdoni and Xavier Suau and Marco Cuturi and Luca Zappella and Pau Rodríguez},
  journal= {arXiv preprint arXiv:2605.08254},
  year   = {2026}
}