AutoMetrics:使用自动生成的评估器模拟人类判断
计算与语言
2025-12-22 v1 人工智能
摘要
评估用户面向的人工智能应用仍是核心挑战,尤其是在开放式领域如旅行规划、临床记录生成或对话中。金标准是用户反馈(如赞/赞成)或行为信号(如保留率),但这些往往在原型和研究项目中稀少,或用于系统优化时速度过慢。我们提出AutoMetrics,一个在低数据约束下合成评估指标的框架。AutoMetrics将来自MetricBank(我们精选的48项指标集合)的检索与自动生成的LLM-as-a-Judge标准相结合,这些标准受轻量级人类反馈驱动。这些指标通过回归进行组成,以最大化与人类信号的相关性。AutoMetrics帮助您从昂贵的措施转向可解释的自动指标。我们在5个多样化任务上测试了AutoMetrics,通过少于100个反馈点,将与人类评级的Kendall相关系数提高了最高可达33.4%。我们展示AutoMetrics可作为可验证的奖励来等效使用。我们发布完整的AutoMetrics工具包和MetricBank,以加速LLM应用的自适应评估。
引用
@article{arxiv.2512.17267,
title = {AutoMetrics: Approximate Human Judgements with Automatically Generated Evaluators},
author = {Michael J. Ryan and Yanzhe Zhang and Amol Salunkhe and Yi Chu and Di Xu and Diyi Yang},
journal= {arXiv preprint arXiv:2512.17267},
year = {2025}
}