QUOTA:面向任意领域的对象计数文本到图像模型量化框架
计算机视觉与模式识别
2025-12-16 v2 机器学习
摘要
我们解决通过生成式文本到图像模型对对象数量进行量化的问题。与为每个感兴趣的图像领域重新训练模型(导致高计算成本和有限可扩展性)不同,我们首次从领域无关的角度考虑这一问题。我们提出了 QUOTA,这是一个面向文本到图像模型的优化框架,使其能够在无需重新训练的情况下实现跨领域的对象计数。它利用双循环元学习策略优化领域不变提示词。进一步地,通过将提示学习与可学习计数和领域标记集成,该方法捕捉风格变异,即使对于训练期间未遇到的元素类别也能保持准确性。对于评估,我们采用了专为对象计数领域泛化设计的新基准,使我们能够严格评估文本到图像生成中对象计数准确性和跨不可见领域的适应性。大量实验表明,QUOTA 在对象计数准确性和语义一致性方面均优于传统模型,为面向任意领域的高效和可扩展文本到图像生成树立了新基准。
引用
@article{arxiv.2411.19534,
title = {QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain},
author = {Wenfang Sun and Yingjun Du and Gaowen Liu and Yefeng Zheng and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:2411.19534},
year = {2025}
}
备注
Accepted by WACV 2026