基于答案可信度评分的大语言模型问题难度估计
计算与语言
2026-05-13 v1 信息检索
摘要
估计问题难度是评估和改进大型语言模型(LLMs)用于问答(QA)的关键环节。现有方法常依赖可读性公式、检索信号或流行度统计,这些方法可能完全捕捉现代LLMs所面临的推理挑战。本文引入Q-DAPS(Question Difficulty based on Answer Plausibility Scores)方法,一种新颖的方法,通过计算候选答案可信度得分的熵来估计问题难度。我们在四个突出QA数据集上系统评估了Q-DAPS——TriviaQA、NQ、MuSiQue和QASC——结果表明其始终优于基线方法。此外,Q-DAPS在超参数变化和问题类型方面表现出强大的鲁棒性。 extensive ablation 研究进一步表明,Q-DAPS 在不同的可信度估计范式、模型规模和现实场景下都保持鲁棒性。人类评估进一步确认,Q-DAPS的难度估计与人类对问题难度的判断高度一致。总体而言,Q-DAPS提供了一种可解释、可扩展且抗偏差的方法,用于现代QA系统中的问题难度估计。
引用
@article{arxiv.2605.12398,
title = {Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring},
author = {Jamshid Mozafari and Bhawna Piryani and Adam Jatowt},
journal= {arXiv preprint arXiv:2605.12398},
year = {2026}
}
备注
Accepted at ACL 2026