理解 AI 评估模式:不同 GPT 模型如何评估视觉-语言描述
人工智能
2025-09-22 v2 计算与语言
摘要
随着 AI 系统越来越多地评估其他 AI 的输出,理解它们的评估行为对于防止级联偏差至关重要。本研究分析了由 NVIDIA 的 Describe Anything 模型生成并由三种 GPT 变体(GPT-4o、GPT-4o-mini、GPT-5)评估的视觉-语言描述,以揭示每个模型展现出的独特“评估个性”——即其底层的评估策略和偏差。GPT-4o-mini 表现出系统一致性且方差极小,GPT-4o 擅长错误检测,而 GPT-5 则表现出极端保守主义和高变异性。使用 Gemini 2.5 Pro 作为独立问题生成器的对照实验验证了这些个性是模型固有的属性,而非人为产物。通过生成问题的语义相似性进行的跨家族分析揭示了显著差异:GPT 模型聚类在一起,相似度高,而 Gemini 则表现出截然不同的评估策略。所有 GPT 模型都表现出 2:1 的偏差,即倾向于负面评估而非正面确认,尽管这种模式似乎是特定于模型家族的,而非跨 AI 架构的普遍现象。这些发现表明,评估能力并不随通用能力同步提升,并且稳健的 AI 评估需要多样化的架构视角。
引用
@article{arxiv.2509.10707,
title = {Understanding AI Evaluation Patterns: How Different GPT Models Assess Vision-Language Descriptions},
author = {Sajjad Abdoli and Rudi Cilibrasi and Rima Al-Shikh},
journal= {arXiv preprint arXiv:2509.10707},
year = {2025}
}