学习从上下文中提取上下文,以实现面向上下文的 LLM 推理
机器学习
2025-12-16 v1
摘要
大型语言模型(LLM)的准用户提示往往是模糊的或不完整的,细微的上下文线索由用户意图、先前知识和风险因素等塑造,对何为恰当的响应具有强烈影响。误解意图或风险可能导致不安全的输出,而过于谨慎的解释则可能导致对善意请求的不必要拒绝。本文质疑 LLM 在不考虑更广泛上下文因素的情况下立即对请求生成响应的常规框架。用户请求 situated within 更广泛的上下文中,如意图、知识和先前经验,这些因素强烈影响何为恰当的答案。我们提出了一个从用户提示本身提取并利用此类上下文信息的框架。具体而言,一个基于强化学习的上下文生成器,采用类似自编码器的方式设计,被训练从提示中推断基于提示的上下文信号,并利用这些信号指导响应生成。这在安全任务中尤为重要,模糊的请求可能绕过安全措施,而善意但令人困惑的请求则可能触发不必要的拒绝。实验表明,我们的方法在 SafetyInstruct 数据集上减少了 5.6% 的有害响应,同时在 XSTest 和 WildJailbreak 上提高了攻击成功率和善意请求合规性调和平均数的 6.2%。这些结果表明,上下文提取对于更安全更可靠的 LLM 推理是有效的。
引用
@article{arxiv.2512.11986,
title = {Learning to Extract Context for Context-Aware LLM Inference},
author = {Minseon Kim and Lucas Caccia and Zhengyan Shi and Matheus Pereira and Marc-Alexandre Côté and Xingdi Yuan and Alessandro Sordoni},
journal= {arXiv preprint arXiv:2512.11986},
year = {2025}
}