中文

大型语言模型中基于提示-响应语义偏差的忠实性幻觉与错位检测指标

计算与语言 2025-08-15 v1 人工智能 机器学习 计算金融

摘要

大型语言模型 (LLM) 的快速发展面临着幻觉问题,这是一种模型生成非事实、荒谬或不忠实文本的关键故障模式。本文引入了语义偏差指标 (SDM),一种新型轻量级框架,用于检测忠实性幻觉——即LLM响应与输入上下文之间严重偏差的事件。我们聚焦于这些LLM错误的特定实现,即{confabulations(自行其事),定义为与用户查询在语义上不一致的任意响应。现有方法如语义熵通过测量单个固定提示的多种答案的多样性来测试 arbitrariness(自行其事)。我们的SDM框架在这一基础上进行了改进,使其更具提示感知性:我们通过测量不仅跨多个答案,还跨多个与原提示在语义上等价的改写版本来测试更深层次的自行其事。方法论上,我们使用联合聚类对句子嵌入进行聚类,在提示和答案之间创建共享主题空间。提示和响应之间主题共现的热图可作为用户与机器对话的量化二维可视化。我们随后计算一组信息论指标来衡量提示和响应之间的语义偏差。我们的实用得分 SH\mathcal{S}_H 将 Jensen-Shannon 散度和 Wasserstein 距离组合起来来量化这种偏差,得分越高表示出现忠实性幻觉。此外,我们识别出 KL 散度 KL(Answer || Prompt) 作为衡量语义探索的强大指示器,这是区分不同生成行为的关键信号。这些指标进一步组合成语义盒子 (Semantic Box),用于对LLM响应类型进行分类,包括危险且自信的自行其事。

关键词

引用

@article{arxiv.2508.10192,
  title  = {Prompt-Response Semantic Divergence Metrics for Faithfulness Hallucination and Misalignment Detection in Large Language Models},
  author = {Igor Halperin},
  journal= {arXiv preprint arXiv:2508.10192},
  year   = {2025}
}

备注

24 pages, 3 figures