VecCISC:利用推理轨迹聚类与候选答案选择改进置信度信息自洽性
人工智能
2026-05-11 v1
摘要
一种标准的推理时扩展技术是自洽性(Self-Consistency),即从大语言模型(LLM)中采样多个候选答案,并选择最常见的答案。最近的研究表明,加权多数投票(例如置信度信息自洽性(CISC)),即为每个候选答案分配一个置信度值并选择累积得分最高的答案,在广泛的流行基准测试中往往更准确。在实践中,加权多数投票需要调用一个评论家 LLM 来评估每个候选答案的推理轨迹,以产生该答案的置信度分数。这一系列额外的 LLM 调用极大地增加了加权多数投票的开销和成本,尽管它具有潜在的性能优势。为了减少这种开销,我们提出了 VecCISC,一个轻量级的自适应框架,它使用语义相似性度量来过滤掉那些与其他轨迹语义等价、退化或产生幻觉的推理轨迹,从而减少必须由评论家评估的候选答案数量。为确保实验的充分性,我们在涵盖数学、化学、生物学、常识推理和人文学科五个领域的、具有挑战性且广泛采用的数据集上评估了 VecCISC。我们的结果表明,VecCISC 在保持或超过 CISC 准确性的同时,将总 token 使用量减少了 47%。
引用
@article{arxiv.2605.08070,
title = {VecCISC: Improving Confidence-Informed Self-Consistency with Reasoning Trace Clustering and Candidate Answer Selection},
author = {James Petullo and Sonny George and Dylan Cashman and Nianwen Xue},
journal= {arXiv preprint arXiv:2605.08070},
year = {2026}
}
备注
Accepted to Findings of ACL 2026