沉默是金的:LLM 能否在时序问答中学会中止?
计算与语言
2026-03-05 v2 人工智能
摘要
大语言模型(LLM)很少承认不确定性,往往会生成流畅但误导性的答案,而非选择中止(即拒绝作答)。这一弱点在时序问答任务中尤为明显,模型常常忽视时序线索,混合不同时期的事实。在本文中,我们首次对训练具备中止能力的 LLM 进行经验研究。现有方法如校准在捕捉复杂推理中的不确定性方面可能不可靠。我们将中止视为可培养的技能,提出一种将链路推理(Chain-of-Thought, CoT)监督与强化学习(Reinforcement Learning, RL)相结合、由中止感知奖励驱动的管道。我们的目标是系统性地分析不同信息类型和训练技术对时序推理中具备中止行为的 LLM 性能的影响。通过大量实验,我们发现 RL 方法在推理方面取得显著提升:以 Qwen2.5-1.5B-Instruct 初始化的模型在 TimeQA-Easy 和 Hard 两个数据集上分别在 Exact Match 上超过 GPT-4o 高出 和 。此外,该方法在不可作答问题的 True Positive rate 上相较纯监督微调(SFT)版本提升了 。更进一步地,我们发现 SFT 会导致模型过度自信,损害可靠性;而 RL 虽提升预测准确度,但仍存在类似风险。最后,通过比较隐式推理线索(如原始上下文、时序子上下文、知识图谱)与显式 CoT 监督,发现隐式信息对具备中止能力的推理帮助有限。我们的研究为如何联合优化中止与推理提供了新见解,为构建更可靠的 LLM 奠定了基础。
引用
@article{arxiv.2602.04755,
title = {When Silence Is Golden: Can LLMs Learn to Abstain in Temporal QA and Beyond?},
author = {Xinyu Zhou and Chang Jin and Carsten Eickhoff and Zhijiang Guo and Seyed Ali Bahrainian},
journal= {arXiv preprint arXiv:2602.04755},
year = {2026}
}
备注
Accepted to ICLR2026