中文

MiRD:基于漏覆盖风险分解的可靠集合值预测用于开放式问答

计算与语言 2026-05-27 v1 人工智能

摘要

可靠的集合值预测提供了一种原则性方法来缓解开放式问答(QA)中的幻觉问题,但现有的共轨方法通常依赖一种脆弱的前提:有限抽样必须已经产生至少一个可接受的候选答案,否则会舍弃校准示例。本文引入 MiRD,一个两个阶段的框架,用于分解整体漏覆盖风险为抽样失败和条件选择失败。在阶段 I 中,MiRD 在固定预算下,建立了有限抽样产生无可接受答案的概率在期望水平上的上界。在阶段 II 中,条件若抽样成功,MiRD 使用基于准入相关非共轨得分的校准选择阈值,覆盖完整校准集,从而保持校准集的完整性。在三个开放式 QA 数据集和八个模型上,MiRD 控制抽样风险、条件选择风险和整体漏覆盖风险,同时比 PAC 风格方法获得更紧的第一阶段界限,比仅使用成功抽样的校准更具自适应性。

关键词

引用

@article{arxiv.2605.27091,
  title  = {MiRD: Reliable Set-Valued Prediction for Open-Ended Question Answering via Miscoverage Risk Decomposition},
  author = {Anqi Hu and Zhiyuan Wang and Zijun Jia and Bo Fu},
  journal= {arXiv preprint arXiv:2605.27091},
  year   = {2026}
}