中文

语境中的区域:基于人类语义推理的文本条件图像编辑

计算机视觉与模式识别 2025-10-21 v1 人工智能

摘要

近期研究在基于文本局部化和编辑图像区域方面取得了显著进展,但大多数方法将这些区域孤立地处理,仅依赖局部线索而不考虑每个区域如何 contribute to 整体的视觉和语义构成。这常导致编辑不一致、转换不自然或整体失去连贯性。本文提出Region in Context(区域语境),一种新型文本条件图像编辑框架,通过视觉与语言之间的多级语义对齐,受人类就编辑相对于整个场景的推理能力的启发。我们的方法鼓励每个区域理解其在全局图像上下文中的角色,从而实现精确且和谐的更改。该框架的核心引入了双层指导机制:区域以完整图像上下文表示,并与详细的区域级描述对齐;整个图像同时与由大型视觉语言模型生成的综合场景级描述相匹配。这些描述作为意图内容的明确语言参考,指导局部修改和全局结构。实验表明,它产生更具连贯性和指令对齐的结果。代码可在 https://github.com/thuyvuphuong/Region-in-Context.git 获取。

关键词

引用

@article{arxiv.2510.16772,
  title  = {Region in Context: Text-condition Image editing with Human-like semantic reasoning},
  author = {Thuy Phuong Vu and Dinh-Cuong Hoang and Minhhuy Le and Phan Xuan Tan},
  journal= {arXiv preprint arXiv:2510.16772},
  year   = {2025}
}