中文

基于可控风险的多选问答中的保守 p 值

计算与语言 2025-08-15 v1 人工智能

摘要

本研究引入了一个增强型保守预测(conformal prediction, CP)框架,以提高大语言模型(LLMs)在多选问答任务(multiple-choice question answering, MCQA)中的可信度。尽管 LLMs 正在越来越多地部署于学科性问答场景,但幻觉和非事实生成 substantially 损害了响应的可靠性。虽然 CP 提供了对预测集合的边际覆盖率保证的统计严谨性,而显著性检验则提供了已建立的统计严谨性,但它们的协同集成仍未被探索。为缓解幻觉和事实不准确的问题,我们的框架将 p 值计算与通过自一致性抽样(self-consistency resampling)的 MCQA 响应的 conformity 评分相结合。该方法计算选项频率,以解决 LLMs 黑箱性质,随后通过原假设检验(H0)构建预测集合,使用经验推导的 p 值。使用即插即用的 LLMs 在 MMLU 和 MMLU-Pro 基准测试上的评估表明:(1)增强型 CP 实现了用户指定的经验漏报率;(2)测试集平均预测集合大小(APSS)随风险水平(alpha)的增加而单调递减,验证了 APSS 作为有效不确定性指标。本工作为在高风险问答应用中可靠地部署 LLM 建立了一个原则性的统计框架。

关键词

引用

@article{arxiv.2508.10022,
  title  = {Conformal P-Value in Multiple-Choice Question Answering Tasks with Provable Risk Control},
  author = {Yuanchang Ye},
  journal= {arXiv preprint arXiv:2508.10022},
  year   = {2025}
}