HarmMetric Eval:衡量 LLM 有害性评估指标与评判器的基准
计算与语言
2026-03-19 v3 人工智能
摘要
大型语言模型(LLM)生成有害内容的潜力构成了数据管理的重大安全风险,而 LLM 正在日益被用作数据生成的引擎。为评估这一风险,提出了众多有害性评估指标和评判器。然而,由于其格式和尺度的差异,这些指标可能在 LLM 生成的有害数据上 yield 不一致的评估结果,削弱了其实际应用中的可信度。为填补这一空白,我们提出 HarmMetric Eval,一个系统化的基准,用于评估具有不同格式和尺度的有害性指标和评判器的质量。HarmMetric Eval 包括高质量数据集,包含代表性有害提示配对的有害与非有害 LLM 输出,覆盖多个细粒度类别,并提供统一的评分机制,以奖励指标正确地对有害输出高于非有害输出。对 HarmMetric Eval 进行的广泛实验发现,一种惊人的发现是:诸如 ROUGE 和 METEOR 等传统参考基准指标在细粒度有害性评估中能超过 LLM 基于评判器,挑战了关于 LLM 在该领域优于性的既有假设。为阐明这一发现的原因,我们提供细粒度分析,解释 LLM 基于评判器在评估无关或无用 LLM 输出时的局限性。受此启发,我们设计了一个改进后的有害性评判器,显式地在其提示模板中纳入细粒度有害性标准,并利用参考基准指标对其基础 LLM 进行轻量级微调。 resulting judge 在 HarmMetric Eval 上实现了最先进的评估效果。
引用
@article{arxiv.2509.24384,
title = {HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment},
author = {Langqi Yang and Tianhang Zheng and Yixuan Chen and Kedong Xiu and Hao Zhou and Wangze Ni and Lei Chen and Zhan Qin and Kui Ren},
journal= {arXiv preprint arXiv:2509.24384},
year = {2026}
}