中文

EpiCaR:认识你不知道的事对 LLM 推理更好

计算与语言 2026-01-13 v1

摘要

改进大型语言模型 (LLM) 的推理能力的工作主要依赖于利用模型生成的数据进行迭代自训练。虽然这种方法在提升准确率方面有效,但现有方法主要强化成功的推理路径,造成显著的校准成本:模型变得过于自信,失去表示不确定性的能力。这种失败已被 characterization 为对齐中的一种模型崩溃形式,预测分布退化为低方差的点估计。我们通过将推理训练重新框定为认知学习问题来解决此问题,即模型必须学习不仅如何推理,还何时可以信赖自己的推理。我们提出了认知校准推理 (EpiCaR) 作为一种训练目标,联合优化推理性能和校准效果,并在使用显式自评估信号的迭代监督微调框架中实现其具体化。实验表明,在 Llama-3 和 Qwen-3 系列模型上,我们的方法在准确率和校准方面均实现了对标准基线的Pareto优势,尤其是在推理能力足够的模型(如 3B+)中尤为显著。该框架可有效推广至 OOD 数学推理任务 (GSM8K) 和代码生成任务 (MBPP)。最终,我们的方法实现了推理计算的3倍降低,仅需 K=10 个样本即可达到 STaR K=30 的性能。

关键词

引用

@article{arxiv.2601.06786,
  title  = {EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMs},
  author = {Jewon Yeom and Jaewon Sok and Seonghyeon Park and Jeongjae Park and Taesup Kim},
  journal= {arXiv preprint arXiv:2601.06786},
  year   = {2026}
}