基于深度学习的黑箱 LLM 知识边界表达方法
计算与语言
2026-02-12 v1 机器学习
摘要
大语言模型(LLMs)取得了显著进展,但内容生成失真(幻觉)现象限制了其实际应用。幻觉的根本原因在于LLMs缺乏对自身存储内部知识的意识,无法像人类一样表达其知识状态以回答超出内部知识边界的问题。现有研究主要聚焦于白箱LLMs,鲜有适用于仅提供API访问且不透露内部参数的黑箱LLMs的方法。针对这一背景,本文提出LSCL(LLM-Supervised Confidence Learning),一种用于表达黑箱LLM知识边界的深度学习方法。基于知识蒸馏框架,本方法设计了深度学习模型。将输入问题、输出答案及来自黑箱LLM的token概率作为输入,构建模型内部知识状态与输入之间的映射,实现对黑箱LLM知识边界的量化与表达。在多个公开数据集上使用多种知名黑箱LLMs进行实验,表明LSCL有效辅助黑箱LLMs准确表达知识边界。在准确率和召回率等指标上显著优于现有基线模型。此外,考虑到部分黑箱LLMs不支持token概率访问,本文还提出了一种自适应替代方法,其性能接近LSCL并超越基线模型。
引用
@article{arxiv.2602.10801,
title = {Deep Learning-based Method for Expressing Knowledge Boundary of Black-Box LLM},
author = {Haotian Sheng and Heyong Wang and Ming Hong and Hongman He and Junqiu Liu},
journal= {arXiv preprint arXiv:2602.10801},
year = {2026}
}