中文

重新审视 NLI:面向评估 LLM 在问答任务中的成本效益与人类对齐指标

计算与语言 2025-11-12 v1 人工智能

摘要

评估来自时代最佳大语言模型 (LLM) 的答案具有挑战性:词汇化指标忽略了语义细微差别,而 "LLM 作为裁判" 评分计算成本高昂。我们重新评估一种轻量级替代方案——使用简单的词汇匹配标识符增强的即插式自然语言推理 (NLI) 评分方法,发现该方法在长形式问答中达到与 GPT-4o 相当的准确率 (89.9%),而所需参数数量仅为其数十倍。为严格测试这些指标的人类对齐性,我们引入 DIVER-QA,一个覆盖五个问答数据集和五个候选 LLM 的 3000 样本的人工标注基准数据集。我们的结果表明,低成本 NLI 基于评估方法仍具竞争力,并将 DIVER-QA 作为未来指标研究的开放资源。

关键词

引用

@article{arxiv.2511.07659,
  title  = {Revisiting NLI: Towards Cost-Effective and Human-Aligned Metrics for Evaluating LLMs in Question Answering},
  author = {Sai Shridhar Balamurali and Lu Cheng},
  journal= {arXiv preprint arXiv:2511.07659},
  year   = {2025}
}