矩阵中的故障?利用 Fakepedia 定位与检测语言模型的基础接地
计算与语言
2025-02-18 v3 人工智能
机器学习
摘要
大型语言模型(LLMs)具有从其上下文中提取新信息的出色能力。然而,这种上下文接地(contextual grounding)的潜在机制仍然未知,尤其是在上下文信息与存储在参数中的事实知识相矛盾的情况下,而 LLMs 同样擅长回忆这些事实知识。偏好上下文信息对于检索增强生成方法至关重要,这些方法用最新信息丰富上下文,期望接地能够纠正过时或含噪的存储知识。我们提出了一种利用 Fakepedia 研究接地能力的新方法,Fakepedia 是一个反事实文本数据集,其构造旨在与模型的内部参数知识相冲突。在本研究中,我们引入了 Fakepedia,这是一个反事实数据集,旨在评估当内部参数知识与上下文信息冲突时的接地能力。我们使用 Fakepedia 对各种 LLMs 进行基准测试,并基于我们的掩码分组因果追踪(MGCT)方法,对 LLMs 在回答 Fakepedia 查询时的组件进行因果中介分析。通过此分析,我们识别了接地与非接地响应之间截然不同的计算模式。我们最终证明,仅通过计算分析即可区分接地与非接地响应。我们的结果,连同关于事实回忆机制的现有发现,为接地与事实回忆机制如何在 LLMs 内部相互作用提供了连贯的叙述。
引用
@article{arxiv.2312.02073,
title = {A Glitch in the Matrix? Locating and Detecting Language Model Grounding with Fakepedia},
author = {Giovanni Monea and Maxime Peyrard and Martin Josifoski and Vishrav Chaudhary and Jason Eisner and Emre Kıcıman and Hamid Palangi and Barun Patra and Robert West},
journal= {arXiv preprint arXiv:2312.02073},
year = {2025}
}
备注
Accepted at ACL 2024 (main conference)