QQJ:用于可扩展且人类对齐评估生成式 AI 的定性判断量化
人工智能
2026-05-19 v1 计算与语言
图形学
摘要
生成式人工智能的快速进步暴露了现有评估方法中的根本局限,尤其是针对开放式、富有创造性且面向人的任务。传统的自动评估指标依赖于表层统计相似性,往往无法反映人类对质量的感知;而纯粹的人类评估虽可靠,但成本高昂、主观且难以扩展。最近一些使用大型语言模型作为评估器的研究方法虽提升了可扩展性,但频常缺乏对人类定义评估原则的明确锚定,导致偏差和不一致。本文引入量化定性判断(Quantifying Qualitative Judgment,QQJ),一个可扩展且以人类为中心的评估框架,显式地桥接了人类判断与自动评估之间的鸿沟。QQJ 通过以专家设计的多维评估量表为基础,对大型语言模型评估器进行校准,以对齐专家推理,实现了质量定义与执行的分离。该设计使得在多样化的生成任务和模态上能够实现一致、可解释且可扩展的评估。广泛的文本和图像生成实验表明,QQJ 在与人类判断的对齐度方面显著优于传统自动指标和不受约束的 LLM 评估器。此外,QQJ 在多次评估中的稳定性更好,在识别诸如幻觉和意图不匹配等关键失效模式方面具有更好的诊断能力。这些结果表明,结构化的定性判断可以在不牺牲可解释性或人类对齐度的前提下,以规模化方式实现操作,将 QQJ 定位为可靠评估现代生成式 AI 系统的实用基础。
引用
@article{arxiv.2605.17382,
title = {QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI},
author = {Marjan Veysi and Pirooz Shamsinejadbabaki and Mohammad Zare and Mohammad Sabouri},
journal= {arXiv preprint arXiv:2605.17382},
year = {2026}
}