中文

基于嵌入排序目标的 Agnostic 验证-A-VERT

计算与语言 2025-10-03 v1 机器学习

摘要

语言模型(LM)响应的自动评估是开发基准和指标的关键环节,既适用于模型训练,也适用于生产模型端点的质量评估。当前的响应分类方法要么计算成本太高(即 LLM-as-a-Judge),要么远离现实场景(字符串匹配、logprob)。本文提出一种无结构的评估方法。该方法利用语义嵌入距离将目标候选者与任意 LM 生成的文本匹配,从而在相对低的计算成本下(参数少于 10B 的嵌入模型)对响应进行稳健的分类。结果显示,该方法在3个数据集和3种不同 LM 架构上的回归得分约为0.97,准确率约为96%,与人类标注员测试结果一致。

关键词

引用

@article{arxiv.2510.01469,
  title  = {A-VERT: Agnostic Verification with Embedding Ranking Targets},
  author = {Nicolás Aguirre and Ramiro Caso and Ramiro Rodríguez Colmeiro and Mauro Santelli and Joaquín Toranzo Calderón},
  journal= {arXiv preprint arXiv:2510.01469},
  year   = {2025}
}

备注

19 pages, 7 figures, code available at https://github.com/pnyxai/a-vert, authors in alphabetical order