TalkPhoto:面向智能图像编辑的无训练对话式助手
计算机视觉与模式识别
2026-01-06 v1
摘要
感谢大型语言模型(LLM)强大的语言理解能力,现有基于指令的方法已引入多模态大型语言模型(MLLM),促进指令与图像之间的信息交换,确保图像编辑的可控性和灵活性。然而,这些框架通常构建多指令数据集来训练模型以处理多种编辑任务,这既耗时又费力,而且难以获得满意的效果。本文提出TalkPhoto,一个灵活且无需训练的图像编辑框架,通过对话交互实现精准图像操作。我们设计了特殊的提示模板,指示开源LLM在接收指令后分析用户需求并分层调用现有的高级编辑方法,无需额外训练。此外,我们实现了插即式且高效的图像编辑方法调用,允许复杂且未见的编辑任务集成到当前框架中,实现稳定且高质量的编辑效果。大量实验表明,我们的方法不仅提供了更准确的调用且token消耗更少,还在各种图像编辑任务中实现更高的编辑质量。
引用
@article{arxiv.2601.01915,
title = {TalkPhoto: A Versatile Training-Free Conversational Assistant for Intelligent Image Editing},
author = {Yujie Hu and Zecheng Tang and Xu Jiang and Weiqi Li and Jian Zhang},
journal= {arXiv preprint arXiv:2601.01915},
year = {2026}
}
备注
a Conversational Assistant for Intelligent Image Editing