GenAI Arena:面向生成模型的开放评估平台
人工智能
2024-11-12 v4 计算机视觉与模式识别
摘要
生成式 AI 已取得显著进展,推动了图像和视频生成等领域的变革。这些进展得益于创新的算法、架构和数据。然而,生成模型的快速扩散凸显了一个关键缺口:可信赖的评估指标缺失。当前的自动评估方法(如 FID、CLIP、FVD 等)往往无法捕捉生成输出所涉及的细微质量和用户满意度。本文提出了一个开放平台 GenAI-Arena,用于评估不同的图像和视频生成模型,用户可积极参与模型评估。通过利用集体用户反馈和投票,GenAI-Arena 旨在提供更具民主性和准确性的模型性能衡量标准。该平台涵盖文本到图像生成、文本到视频生成和图像编辑三个任务。目前,我们覆盖了 35 个开源生成模型。GenAI-Arena 已运营七个月,社区累计获得超过 9000 票的投票。我们描述了平台情况、分析了数据,并解释了用于模型排名的统计方法。为进一步推动基于模型的评估指标研究,我们发布了针对三个任务清理后的偏好数据,称为 GenAI-Bench。我们邀请现有的多模态模型(如 Gemini、GPT-4o)模拟人类投票。我们计算模型投票与人类投票之间的一致性,以了解其判断能力。我们的结果表明,现有的多模态模型在评估生成视觉内容方面仍落后于人类,即便是最佳模型 GPT-4o 在三个生成任务中的平均准确率也仅为 49.19%。开源多模态大语言模型的表现更差,原因是它们在复杂视觉情境中缺乏指令遵循和推理能力。
引用
@article{arxiv.2406.04485,
title = {GenAI Arena: An Open Evaluation Platform for Generative Models},
author = {Dongfu Jiang and Max Ku and Tianle Li and Yuansheng Ni and Shizhuo Sun and Rongqi Fan and Wenhu Chen},
journal= {arXiv preprint arXiv:2406.04485},
year = {2024}
}
备注
9 pages,7 figures