VibeCheck:发现并量化大型语言模型中的质感差异
计算与语言
2025-04-22 v7 人工智能
摘要
大型语言模型 (LLM) 常在输出中表现出用户直观感知但难以量化的细微且独特性的 "vibes",例如语气、格式或写作风格。这些 "vibes" 影响用户偏好,而传统评估主要聚焦于正确性这一单一维度。我们引入 VibeCheck,一个用于自动比较成对 LLM 的系统,通过发现能区分模型 (vibes) 的特征,这些特征应当是明确定义的、具有区分性的,并且与用户认知一致。VibeCheck 通过迭代发现模型输出中的 vibes,然后利用一组 LLM 评判员对每个 vibe 的实用性进行量化测量。我们验证了 VibeCheck 生成的 vibes 与人类发现的一致,并在 Llama-3-70b 与 GPT-4 的成对偏好数据中运行 VibeCheck。VibeCheck 揭示 Llama 具有友好、幽默且略带争议的 vibe。这些 vibes 能够以 80% 的准确率预测模型身份,并以 61% 的准确率预测人类偏好。最后,我们在多种模型和任务上运行 VibeCheck,包括摘要、数学和描述,提供有关模型行为差异的见解。VibeCheck 发现的 vibes 包括:Command X 在摘要时倾向于添加具体的引言和结论,与 TNGL 不同;Llama-405b 在数学问题中常对其思考过程进行过度解释,与 GPT-4o 不同;GPT-4 在描述时倾向于关注场景的情绪和情感,与 Gemini-1.5-Flash 不同。代码和 vibe 可视化工具可在 https://bench-mark.org/ 查找。
引用
@article{arxiv.2410.12851,
title = {VibeCheck: Discover and Quantify Qualitative Differences in Large Language Models},
author = {Lisa Dunlap and Krishna Mandal and Trevor Darrell and Jacob Steinhardt and Joseph E Gonzalez},
journal= {arXiv preprint arXiv:2410.12851},
year = {2025}
}
备注
unironic use of the word 'vibe', added more analysis and cooler graphs. added website link