从简单到专业:组合式可控图像描述智能体
计算机视觉与模式识别
2025-01-13 v1 人工智能
摘要
可控图像描述智能体(CapAgent)是一个创新的系统,旨在弥合图像描述任务中用户输入的简单性与专业级输出之间的差距。CapAgent 自动将用户提供的简单指令转换为详细的专业指令,从而实现精确且具备上下文感知的描述生成。通过利用多模态大语言模型(MLLMs)以及目标检测工具和搜索引擎等外部工具,该系统确保描述遵循指定的指导原则,包括情感、关键词、焦点和格式。CapAgent 透明地控制描述过程的每一步,并在每一步展示其推理和工具使用,从而促进用户的信任和参与。项目代码可在 https://github.com/xin-ran-w/CapAgent 获取。
引用
@article{arxiv.2412.11025,
title = {From Simple to Professional: A Combinatorial Controllable Image Captioning Agent},
author = {Xinran Wang and Muxi Diao and Baoteng Li and Haiwen Zhang and Kongming Liang and Zhanyu Ma},
journal= {arXiv preprint arXiv:2412.11025},
year = {2025}
}
备注
A technical report. Project: https://github.com/xin-ran-w/CapAgent