推进神经信息检索中的持续终身学习:定义、数据集、框架与实证评估
信息检索
2024-06-21 v2 计算与语言
摘要
持续学习指机器学习模型学习并适应新信息而不损害其在已学任务上性能的能力。尽管已有若干研究探讨面向信息检索任务的持续学习方法,但仍缺乏良好定义的任务表述,且典型学习策略在此情境下的表现尚不明晰。为应对该挑战,本文给出持续神经信息检索的系统性任务表述,以及模拟连续信息检索的多主题数据集;进而提出由典型检索模型与持续学习策略构成的综合持续神经信息检索框架。实证评估表明,所提框架能成功防止神经信息检索中的灾难性遗忘,并提升在已学任务上的表现。结果显示,基于嵌入的检索模型其持续学习性能随新任务主题偏移距离与数据量的增大而下降,而基于预训练的模型则未呈现此类相关性。采用合适的学习策略可缓解主题偏移与数据增广的影响。
引用
@article{arxiv.2308.08378,
title = {Advancing continual lifelong learning in neural information retrieval: definition, dataset, framework, and empirical evaluation},
author = {Jingrui Hou and Georgina Cosma and Axel Finke},
journal= {arXiv preprint arXiv:2308.08378},
year = {2024}
}
备注
Submitted to Information Sciences