中文

从情感到指标:理解与形式化用户如何进行 LLM vibe-test

计算与语言 2026-04-17 v2 人工智能 机器学习

摘要

评估LLM具有挑战性,因为基准得分往往难以捕捉模型在实际应用中的实用性。相反,用户往往依赖“vibe-test”:即基于经验的非正式评估,如针对与自身工作流程相关的编码任务进行比较。尽管这种做法广泛存在,但vibe-test往往过于随意且缺乏结构,难以进行大规模分析或复现。在本工作中,我们研究vibe-test在实际中的工作方式,然后对其进行形式化以支持系统化分析。首先,我们分析了两个经验资源:(1) 用户评估实践的调查,和(2) 来自博客和社交媒体的野生模型比较报告集合。基于这些资源,我们将vibe-test形式化为一个两部分过程:用户同时个性化他们测试的内容和如何判断响应。随后,我们引入了一个概念验证评估管道,遵循此形式化方案,通过生成个性化提示并使用用户感知的主观标准来比较模型输出。在化学基准测试中进行实验,我们发现,结合个性化提示和用户感知的评估可能会改变首选模型的顺序,反映出vibe-test在实践中的作用。这些发现表明,形式化的vibe-test可作为一种有用的方法,用以搭建基准得分与实际体验之间的桥梁。

关键词

引用

@article{arxiv.2604.14137,
  title  = {From Feelings to Metrics: Understanding and Formalizing How Users Vibe-Test LLMs},
  author = {Itay Itzhak and Eliya Habba and Gabriel Stanovsky and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2604.14137},
  year   = {2026}
}

备注

Under review. 42 pages, 18 figures. Code and data at https://technion-cs-nlp.github.io/vibe-testing-llms