中文

ReGround:零成本改善文本与空间定位

计算机视觉与模式识别 2024-07-22 v3

摘要

当图像生成过程同时受到文本提示和空间线索(例如一组边界框)的引导时,这些元素是协同工作,还是其中一个主导另一个?我们对一个将门控自注意力集成到U-Net中的预训练图像扩散模型的分析表明,由于从门控自注意力到交叉注意力的顺序流,空间定位往往优于文本定位。我们证明,通过简单地重新连接网络架构,将门控自注意力和交叉注意力从顺序连接改为并行连接,可以在不牺牲任何一种定位准确性的情况下显著减轻这种偏差。这种出奇简单但有效的解决方案不需要对网络进行任何微调,却能显著减少两种定位之间的权衡。我们的实验表明,从原始的GLIGEN到重新连接后的版本,在文本定位和空间定位之间的权衡方面取得了显著改进。

关键词

引用

@article{arxiv.2403.13589,
  title  = {ReGround: Improving Textual and Spatial Grounding at No Cost},
  author = {Phillip Y. Lee and Minhyuk Sung},
  journal= {arXiv preprint arXiv:2403.13589},
  year   = {2024}
}

备注

Accepted to ECCV 2024. Project page: https://re-ground.github.io/