让我们逐变量思考:大语言模型实现即时概率推理
计算与语言
2024-12-04 v1
摘要
智能的一个标志性特征是能够在缺乏明确情境信息时运用“常识”进行推演。我们提出从大语言模型(LLM)中提取这种常识,并以可用于概率推理的形式呈现。我们聚焦于 类问题,如“纽伦堡(Newark, NJ)的 Airbnb 房源价格是多少?”。要得出没有数据访问的合理答案,需要依据关于 与 可能与其他变量(如 )之间的关系的常识知识进行推理。我们的框架通过综合 概率模型来回答此类问题。首先我们引导 LLM 提出一组与问题相关的随机变量,随后给出它们联合分布的矩约束。我们然后在对数线性家族中优化联合分布 ,以最大化整体约束满足度。我们的实验表明,LLM 能够成功地被引导提出合理变量,而虽然所提出的数值约束可能较为嘈杂,但联合优化后能实现相互制约。我们在来自三个真实世界表格数据集的概率问题上进行评估,发现该框架在与数据分布的总变差距离方面,与直接引导基线方法相当,并且在抗噪能力上也表现出色。
引用
@article{arxiv.2412.02081,
title = {Let's Think Var-by-Var: Large Language Models Enable Ad Hoc Probabilistic Reasoning},
author = {Shepard Xia and Brian Lu and Jason Eisner},
journal= {arXiv preprint arXiv:2412.02081},
year = {2024}
}