基于嵌入排序目标的 Agnostic 验证-A-VERT
计算与语言
2025-10-03 v1 机器学习
摘要
语言模型(LM)响应的自动评估是开发基准和指标的关键环节,既适用于模型训练,也适用于生产模型端点的质量评估。当前的响应分类方法要么计算成本太高(即 LLM-as-a-Judge),要么远离现实场景(字符串匹配、logprob)。本文提出一种无结构的评估方法。该方法利用语义嵌入距离将目标候选者与任意 LM 生成的文本匹配,从而在相对低的计算成本下(参数少于 10B 的嵌入模型)对响应进行稳健的分类。结果显示,该方法在3个数据集和3种不同 LM 架构上的回归得分约为0.97,准确率约为96%,与人类标注员测试结果一致。
引用
@article{arxiv.2510.01469,
title = {A-VERT: Agnostic Verification with Embedding Ranking Targets},
author = {Nicolás Aguirre and Ramiro Caso and Ramiro Rodríguez Colmeiro and Mauro Santelli and Joaquín Toranzo Calderón},
journal= {arXiv preprint arXiv:2510.01469},
year = {2025}
}
备注
19 pages, 7 figures, code available at https://github.com/pnyxai/a-vert, authors in alphabetical order