关于时间:在检索增强语言模型中引入时间性
信息检索
2024-01-26 v2
摘要
网络作为一个全球知识库,被数十亿人用来搜索信息。确保用户接收到最相关和最新的信息,尤其是在存在来自不同时间点的多个网络内容版本的情况下,仍然是信息检索面临的一个关键挑战。由于在 Wikipedia 或网络内容上训练并由大语言模型(LLM)驱动的问答工具的使用增加,这一挑战最近变得更加复杂,这些工具被发现会编造信息(或产生幻觉),此外还被证明在处理信息的时间维度方面存在困难。即使是结合文档数据库以减少 LLM 幻觉的检索增强语言模型(RALM)也无法正确处理时间查询。这导致 RALM 在响应诸如“谁赢得了温布尔登网球锦标赛?”之类的查询时,会检索与温布尔登相关的文档段落,但无法根据它们的时效性来区分它们。在本文中,我们提出并评估了 TempRALM,一种具有少样本学习扩展的时间感知检索增强语言模型(RALM),它考虑了相对于给定查询在语义和时间上都相关的文档,而不是仅仅依赖语义相似性。我们表明,与基线 RALM 模型相比,我们的方法性能提升了高达 74%,且不需要模型预训练、重新计算或替换 RALM 文档索引,也不添加其他计算密集型元素。
引用
@article{arxiv.2401.13222,
title = {It's About Time: Incorporating Temporality in Retrieval Augmented Language Models},
author = {Anoushka Gade and Jorjeta Jetcheva},
journal= {arXiv preprint arXiv:2401.13222},
year = {2024}
}