SIFT:通过贴纸将大语言模型推理 grounded 在上下文中
计算与语言
2025-02-24 v1 人工智能
摘要
本文指出,大语言模型在推理过程中对上下文的误解释是一个显著问题,涵盖从 Llama3.2-3B-Instruct 这类较小模型到 DeepSeek-R1 这类最前沿模型。例如,在“10 dollars per kilo”这句话中,LLMs 可能无法识别“per”意为“for each”,导致计算错误。我们提出了一种新颖的、训练后方法——**Stick to the Facts (SIFT)**,以解决此问题。SIFT 利用增加的推理计算资源将 LLM 推理 grounded 在上下文中。SIFT 的核心是*贴纸*(Sticker),它由模型自身生成,以显式强调上下文中的关键信息。根据筛选后的贴纸,SIFT 生成两个预测——一个来自原始查询,一个来自与贴纸拼接后的查询。如果两者不同,贴纸将通过*前向*优化(更好地将提取的事实与查询对齐)和*逆向*生成(符合模型固有的倾向)进行顺序细化,以获得更可靠的推理结果。跨越 diverse models(从 3B 到 100B+)和基准测试(如 GSM8K、MATH-500)的研究显示,性能均得到一致提升。值得注意的是,SIFT 将 DeepSeek-R1 在 AIME2024 上的 pass@1 accuracy 从 78.33% 提升至 **85.67%**,在开源社区中树立了新的 state-of-the-art。代码已公开于 https://github.com/zhijie-group/SIFT。
引用
@article{arxiv.2502.14922,
title = {SIFT: Grounding LLM Reasoning in Contexts via Stickers},
author = {Zihao Zeng and Xuyao Huang and Boxiu Li and Zhijie Deng},
journal= {arXiv preprint arXiv:2502.14922},
year = {2025}
}