我们可以信任黑箱 LLM 吗?基于偏差扩散和多智能体强化学习的 LLM 可信度边界检测
人工智能
2026-04-08 v1 计算与语言
摘要
大型语言模型 (LLM) 在多样化主题的问题解答方面展现出高强度能力。然而,这些模型有时会生成偏见、意识形态化或错误的响应,这限制了其应用范围,若无法清晰理解其答案可信的主题范围。本研究引入一种新型算法,命名为 GMRL-BD,旨在识别给定 LLM 在特定主题上的不可信边界(以主题为单位),在对 LLM 仅具备黑箱访问权限且受特定查询约束的前提下工作。基于从维基百科派生的通用知识图谱 (KG),我们的算法融合了多个强化学习智能体,以高效识别 LLM 可能生成偏见答案的主题(KG 中的某些节点)。我们的实验表明,该算法效率高效,仅通过有限的查询即可检测不可信边界。此外,我们发布了一个新数据集,包含流行的 LLM(包括 Llama2、Vicuna、Falcon、Qwen2、Gemma2 和 Yi-1.5),并标注了每种 LLM 可能偏见的主题。
引用
@article{arxiv.2604.05483,
title = {Can We Trust a Black-box LLM? LLM Untrustworthy Boundary Detection via Bias-Diffusion and Multi-Agent Reinforcement Learning},
author = {Xiaotian Zhou and Di Tang and Xiaofeng Wang and Xiaozhong Liu},
journal= {arXiv preprint arXiv:2604.05483},
year = {2026}
}