中文

TalkPhoto:面向智能图像编辑的无训练对话式助手

计算机视觉与模式识别 2026-01-06 v1

摘要

感谢大型语言模型(LLM)强大的语言理解能力,现有基于指令的方法已引入多模态大型语言模型(MLLM),促进指令与图像之间的信息交换,确保图像编辑的可控性和灵活性。然而,这些框架通常构建多指令数据集来训练模型以处理多种编辑任务,这既耗时又费力,而且难以获得满意的效果。本文提出TalkPhoto,一个灵活且无需训练的图像编辑框架,通过对话交互实现精准图像操作。我们设计了特殊的提示模板,指示开源LLM在接收指令后分析用户需求并分层调用现有的高级编辑方法,无需额外训练。此外,我们实现了插即式且高效的图像编辑方法调用,允许复杂且未见的编辑任务集成到当前框架中,实现稳定且高质量的编辑效果。大量实验表明,我们的方法不仅提供了更准确的调用且token消耗更少,还在各种图像编辑任务中实现更高的编辑质量。

关键词

引用

@article{arxiv.2601.01915,
  title  = {TalkPhoto: A Versatile Training-Free Conversational Assistant for Intelligent Image Editing},
  author = {Yujie Hu and Zecheng Tang and Xu Jiang and Weiqi Li and Jian Zhang},
  journal= {arXiv preprint arXiv:2601.01915},
  year   = {2026}
}

备注

a Conversational Assistant for Intelligent Image Editing