仅在必要时调用接口:大语言模型问答中的自适应调用
计算与语言
2025-11-11 v2
摘要
大型和小型语言模型(LMs)的协同范式有效平衡了性能与成本,但其关键挑战在于精准把握何时调用大型模型以应对小型模型中出现的幻觉。以往的优化工作主要聚焦于后处理技术,这些技术独立于语言模型的推理过程,导致计算成本高且效果有限。本文提出实用的调用评估指标AttenHScore,其计算小型模型生成过程中幻觉的积累与传播,不断放大潜在推理错误。通过动态调整检测阈值,我们实现了对大型模型更精准的实时调用。此外,考虑到小型模型的推理能力有限,我们利用不确定性感知的知识重组织帮助其更好地从不同文本块中捕获关键信息。大量实验表明,AttenHScore 在多个问答数据集上超越了大多数基线,尤其在处理复杂查询时表现突出。我们的策略无需额外模型训练,灵活适配各种基于变换器的语言模型。
引用
@article{arxiv.2505.02311,
title = {Invoke Interfaces Only When Needed: Adaptive Invocation for Large Language Models in Question Answering},
author = {Jihao Zhao and Chunlai Zhou and Daixuan Li and Shuaishuai Zu and Biao Qin},
journal= {arXiv preprint arXiv:2505.02311},
year = {2025}
}