中文

思考明亮,扩散良好:通过归纳偏差提示指令与查询对抗解码提升文本到图像零样例学习

计算机视觉与模式识别 2026-01-13 v1

摘要

文本到图像零样例学习(Text-to-Image In-Context Learning, T2I-ICL)通过交错排列的文本-图像示例实现定制化图像合成,但面临两个相互强化的瓶颈:合规性失败和先验主导的幻觉,这两个瓶颈形成恶性循环,导致生成质量下降。现有方法依赖特定训练,限制了灵活性并提高了部署成本。为有效解决这些挑战,我们提出了TBDN(Think Bright, Diffuse Nice),一个无需训练的框架,集成两个互补的闭环机制:提示指令(Hint Instruction, HI)和查询对抗解码(Query Contrastive Decoding, QCD)。HI通过轻量级提示工程注入任务感知的归纳偏差,锚定模型对上下文映射规则的理解,从而缓解合规性失败。QCD通过对比完整输入分布和省略查询分布,调整语言模型的解码分布,抑制先验主导的幻觉。TBDN在CoBSAT和Text-to-Image Fast Mini-ImageNet上实现了最先进的性能,并在模型背bone、提示设计和超参数方面表现出稳健的泛化能力。在Dreambench++上,TBDN在概念保持和提示跟随方面也保持了有前景的性能。通过打破这两个瓶颈,TBDN为高效可靠的T2I-ICL建立了一个简单而有效的框架。

关键词

引用

@article{arxiv.2601.06169,
  title  = {Think Bright, Diffuse Nice: Enhancing T2I-ICL via Inductive-Bias Hint Instruction and Query Contrastive Decoding},
  author = {Zhiyong Ma and Zhenpeng Li and Yuanjie Shi and Zhengping Li and Jiahao Chen and Qingyuan Chuai},
  journal= {arXiv preprint arXiv:2601.06169},
  year   = {2026}
}

备注

Submitted to ACL 2026