串联线索:LLM能从分散的训练数据中推断并表述潜在结构
计算与语言
2024-12-24 v3 人工智能
机器学习
摘要
应对大型语言模型(LLM)安全风险的一种方法是审查其训练数据中的危险知识。虽然这移除了显式信息,但隐式信息可能仍然分散在各种训练文档中。LLM能否通过拼凑这些隐式线索来推断被审查的知识?作为回答这个问题的一步,我们研究了归纳式上下文外推理(OOCR),这是一种泛化类型,其中LLM从分布在训练文档中的证据推断潜在信息,并将其应用于下游任务,而无需进行上下文学习。通过一套包含五个任务的测试,我们证明了前沿LLM能够执行归纳式OOCR。在一个实验中,我们微调了一个LLM,其语料库仅包含一个未知城市与其他已知城市之间的距离。值得注意的是,在没有上下文示例或思维链的情况下,LLM能够表述出未知城市是巴黎,并利用这一事实回答下游问题。进一步的实验表明,仅训练于单个硬币抛掷结果的LLM能够表述硬币是否有偏,而仅训练于成对数据(x, f(x))的LLM能够阐明f的定义并计算其逆函数。虽然OOCR在一系列案例中取得了成功,但我们也表明它并不可靠,特别是对于学习复杂结构的较小LLM而言。总体而言,LLM在没有显式上下文学习的情况下“串联线索”的能力,对监控和控制LLM所获取的知识构成了潜在障碍。
引用
@article{arxiv.2406.14546,
title = {Connecting the Dots: LLMs can Infer and Verbalize Latent Structure from Disparate Training Data},
author = {Johannes Treutlein and Dami Choi and Jan Betley and Samuel Marks and Cem Anil and Roger Grosse and Owain Evans},
journal= {arXiv preprint arXiv:2406.14546},
year = {2024}
}
备注
Accepted at NeurIPS 2024. 10 pages, 8 figures