中文

面向多轮图像编辑的代价敏感工具路径代理 CoSTA$

计算机视觉与模式识别 2025-03-14 v1

摘要

文本到图像模型如 stable diffusion 和 DALLE-3 仍在处理多轮图像编辑方面存在挑战。我们将此类任务分解为由工具使用序列成为的代理工作流程,以解决一系列由不同代价的子任务。传统搜索算法需要高成本的探索才能找到工具路径。虽然大语言模型(LLM)拥有子任务规划的先验知识,但可能缺乏准确估计工具能力和代价的能力,以确定在每个子任务中应应用哪些工具。我们能否将 LLM 与图搜索的优势结合,以找到高性价比的工具路径?我们提出了三阶段方法“CoSTA”,利用LLM创建子任务树以修剪给定任务的AI工具图,然后在小型子图上进行A”,利用 LLM 创建子任务树以修剪给定任务的 AI 工具图,然后在小型子图上进行 A 搜索以找到工具路径。为更好地平衡总体代价和质量,CoSTA将每个工具在每个子任务上的每个指标组合,以指导A 将每个工具在每个子任务上的每个指标组合,以指导 A 搜索。随后,每个子任务的输出将由视觉语言模型(VLM)评估,若失败则触发该工具在该子任务上的代价和质量更新,从而使 A搜索能够快速恢复以探索其他路径。此外,CoSTA 搜索能够快速恢复以探索其他路径。此外,CoSTA 能够在子任务之间自动切换模态,以获得更好的代价-质量权衡。在我们构建的创新多轮图像编辑基准测试上,CoSTA$ 在代价和质量方面均优于基于图像编辑模型或代理的先进技术,并能根据用户偏好实现灵活的权衡。

关键词

引用

@article{arxiv.2503.10613,
  title  = {CoSTA$\ast$: Cost-Sensitive Toolpath Agent for Multi-turn Image Editing},
  author = {Advait Gupta and NandaKiran Velaga and Dang Nguyen and Tianyi Zhou},
  journal= {arXiv preprint arXiv:2503.10613},
  year   = {2025}
}