中文

DiffAgent: 基于大语言模型的快速准确文本到图像API选择

计算与语言 2024-04-03 v1 人工智能

摘要

文本到图像(T2I)生成模型引起了广泛关注,并在学术研究内外找到了广泛应用。例如,Civitai社区(一个T2I创新平台)目前拥有令人印象深刻的74,492个不同模型。然而,这种多样性在选择最合适的模型和参数时带来了巨大挑战,这一过程通常需要大量试验。受大语言模型(LLM)工具使用研究的启发,我们引入了DiffAgent,一个LLM智能体,旨在通过API调用在几秒钟内筛选出准确的选择。DiffAgent利用一种新颖的两阶段训练框架SFTA,使其能够根据人类偏好准确地将T2I API响应与用户输入对齐。为了训练和评估DiffAgent的能力,我们提出了DABench,一个包含社区中广泛T2I API的综合数据集。我们的评估表明,DiffAgent不仅在识别合适的T2I API方面表现出色,而且突显了SFTA训练框架的有效性。代码可在https://github.com/OpenGVLab/DiffAgent获取。

关键词

引用

@article{arxiv.2404.01342,
  title  = {DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model},
  author = {Lirui Zhao and Yue Yang and Kaipeng Zhang and Wenqi Shao and Yuxin Zhang and Yu Qiao and Ping Luo and Rongrong Ji},
  journal= {arXiv preprint arXiv:2404.01342},
  year   = {2024}
}

备注

Published as a conference paper at CVPR 2024