超越文本 CoT:基于深度置信度推理的交错文本-图像链用于图像编辑
计算机视觉与模式识别
2025-10-10 v1
摘要
图像编辑使用自然语言已获得广泛关注,但现有方法在处理复杂对象相交和细粒度空间关系方面受限,由于缺乏明确的推理过程。虽然已探索链式思维(CoT)以增强推理,但纯文本 CoT 或仅结合坐标信息的 CoT 在表示复杂视觉布局方面受限,缺乏引导生成细粒度像素级细节的必要视觉线索。为此,我们提出一种多模态推理编辑框架(MURE),将视觉编辑过程从纯文本推理转向一系列交错的文本和视觉理由。该框架使用原生多模态、交错文本-图像 CoT 进行图像编辑。该方法生成逐步推理链,其中文本描述后跟一个对应的视觉线索,如定义待编辑区域的positional mask 或表示新内容的表示。此外,为缓解大型语言模型的幻觉现象,我们引入多模态深度置信度(MMDC)推理范式。该范式在每个步骤处探索视觉推理路径的树状结构。通过使用来自奖励模型的深度置信度分数修剪低质量分支,确保模型始终遵循高质量轨迹以实现最终编辑结果。该方法将复杂编辑任务分解为相互依赖的子任务,在每个阶段实现更高的精度,生成高保真度的编辑结果。我们定义了交错文本-图像链的表述,并发布了首个 CoT-Edit-14K 数据集,包含 14K 条高质量编辑示例。大量实验表明,我们的方法在三个图像编辑基准测试中显著提升了性能。
引用
@article{arxiv.2510.08157,
title = {Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing},
author = {Zhentao Zou and Zhengrong Yue and Kunpeng Du and Binlei Bao and Hanting Li and Haizhen Xie and Guozheng Xu and Yue Zhou and Yali Wang and Jie Hu and Xue Jiang and Xinghao Chen},
journal= {arXiv preprint arXiv:2510.08157},
year = {2025}
}
备注
25pages,20figures