指令引导的图像与多媒体编辑控制:LLM 时代综述
计算机视觉与模式识别
2024-11-22 v2 人工智能
人机交互
机器学习
多媒体
摘要
大语言模型(LLMs)和多模态学习的快速发展改变了数字内容的创建与操作。传统视觉编辑工具需要大量专业知识,限制了其普及性。近期基于指令的编辑进展实现了与视觉内容的直观交互,利用自然语言作为用户意图与复杂编辑操作之间的桥梁。本综述概述了这些技术,重点探讨 LLMs 和多模态模型如何赋能用户在无需深厚技术知识的情况下实现精准视觉修改。通过综合 100 余篇文献,我们探讨了从生成对抗网络到扩散模型的方法,考察多模态融合以实现细粒度内容控制。我们讨论了时尚、三维场景操作和视频合成等领域的实际应用,突显了易用性的提升和与人类直觉的契合。本综述对比了现有文献,强调 LLM 赋能的编辑,并指出关键挑战以激发后续研究。我们旨在让强大的视觉编辑技术在娱乐到教育等各行业普及。建议感兴趣的读者访问我们的代码库:https://github.com/tamlhp/awesome-instruction-editing。
引用
@article{arxiv.2411.09955,
title = {Instruction-Guided Editing Controls for Images and Multimedia: A Survey in LLM era},
author = {Thanh Tam Nguyen and Zhao Ren and Trinh Pham and Thanh Trung Huynh and Phi Le Nguyen and Hongzhi Yin and Quoc Viet Hung Nguyen},
journal= {arXiv preprint arXiv:2411.09955},
year = {2024}
}
备注
Fixed a serious error in author information