MiRD:基于漏覆盖风险分解的可靠集合值预测用于开放式问答
计算与语言
2026-05-27 v1 人工智能
摘要
可靠的集合值预测提供了一种原则性方法来缓解开放式问答(QA)中的幻觉问题,但现有的共轨方法通常依赖一种脆弱的前提:有限抽样必须已经产生至少一个可接受的候选答案,否则会舍弃校准示例。本文引入 MiRD,一个两个阶段的框架,用于分解整体漏覆盖风险为抽样失败和条件选择失败。在阶段 I 中,MiRD 在固定预算下,建立了有限抽样产生无可接受答案的概率在期望水平上的上界。在阶段 II 中,条件若抽样成功,MiRD 使用基于准入相关非共轨得分的校准选择阈值,覆盖完整校准集,从而保持校准集的完整性。在三个开放式 QA 数据集和八个模型上,MiRD 控制抽样风险、条件选择风险和整体漏覆盖风险,同时比 PAC 风格方法获得更紧的第一阶段界限,比仅使用成功抽样的校准更具自适应性。
引用
@article{arxiv.2605.27091,
title = {MiRD: Reliable Set-Valued Prediction for Open-Ended Question Answering via Miscoverage Risk Decomposition},
author = {Anqi Hu and Zhiyuan Wang and Zijun Jia and Bo Fu},
journal= {arXiv preprint arXiv:2605.27091},
year = {2026}
}