中文

提示词能否为大型语言模型倒流时间?评估提示词驱动知识截止的有效性

计算与语言 2025-10-16 v2 机器学习

摘要

大型语言模型(LLM)广泛用于时序预测,但其依赖预训练数据引发了质疑,因为对 pre-cutoff 测试数据的准确预测可能反映记忆而非推理,导致对其泛化能力的高估。随着基于提示的无学习技术的兴起,一个自然问题浮现:LLM 是否可以被提示来模拟更早的知识截止?本文我们研究提示词模拟更早知识截止在 LLM 中的能力。我们构建了三个评估数据集,以衡量 LLM 可忘记(1)直接事实知识、(2)语义偏移和(3)因果相关知识的程度。结果表明,尽管提示词驱动的模拟知识截止在直接查询该信息后日期后表现有效,但在被忘记内容未被直接询问而与查询有因果关联时,难以诱导忘记。这一发现凸显了在应用 LLM 进行时序预测任务时,需要更严格的评估环境。完整数据集和评估代码已公开于 https://github.com/gxx27/time_unlearn。

关键词

引用

@article{arxiv.2510.02340,
  title  = {Can Prompts Rewind Time for LLMs? Evaluating the Effectiveness of Prompted Knowledge Cutoffs},
  author = {Xin Gao and Ruiyi Zhang and Daniel Du and Saurabh Mahindre and Sai Ashish Somayajula and Pengtao Xie},
  journal= {arXiv preprint arXiv:2510.02340},
  year   = {2025}
}

备注

Published at EMNLP 2025; Code and data available at https://github.com/gxx27/time_unlearn