基于信息瓶颈的LLM输入输出对话题识别
计算与语言
2025-09-05 v1 机器学习
综合金融
摘要
大语言模型(LLM)容易出现关键失效模式,包括内在忠实性幻觉(也称为妄想),即响应在语义上偏离提供的上下文。旨在检测此类失效的框架(如语义散度指标SDM)依赖于识别提示与响应之间共享的潜在话题,通常通过对句子嵌入应用几何聚类来实现。这导致一种偏差,因为话题是为空间接近性优化的,而非为后续信息论分析优化。本文通过发展一种基于确定性信息瓶颈(DIB)的原则性话题识别方法来弥合这一差距。我们的关键贡献是将DIB方法转化为可用于高维数据的实用算法,通过用计算效率的上界取代其难以计算的KL散度项。 resulting 方法,我们称之为UDIB,可解释为一种熵正则化且稳健的K-means版本,天然偏好parsimonious(精简的)信息性聚类。通过将UDIB应用于LLM提示和响应嵌入的联合聚类,我们生成的共享话题表征不仅在空间上连贯,而且在本质上结构化为对提示-响应关系信息 maximally(最大化)有益。这为SDM框架提供了更优的基础,并提供一种更敏感的工具用于检测妄想。
引用
@article{arxiv.2509.03533,
title = {Topic Identification in LLM Input-Output Pairs through the Lens of Information Bottleneck},
author = {Igor Halperin},
journal= {arXiv preprint arXiv:2509.03533},
year = {2025}
}
备注
26 pages, 4 figures