中文

交互式信息检索中强化学习训练经验的平衡

信息检索 2021-06-10 v2 人工智能

摘要

交互式信息检索(IIR)与强化学习(RL)有许多共性,包括一个在交互中学习的智能体、一个长期且复杂的目标,以及一种探索并适应的算法。要将 RL 方法成功应用于 IIR,一个挑战是获得足够的的相关性标注以训练 RL 智能体,而 RL 以样本低效著称。然而,在针对给定查询标注的文本语料库中,占主导地位的并非相关文档而是不相关文档。这会导致智能体的训练经验极不平衡,阻碍其学习任何有效策略。本文通过使用域随机化合成更多相关文档用于训练来解决此问题。我们在 Text REtrieval Conference (TREC) Dynamic Domain (DD) 2017 Track 上的实验结果表明,所提方法能将 RL 智能体处理未知情形的学习有效性提升 22%。

关键词

引用

@article{arxiv.2006.03185,
  title  = {Balancing Reinforcement Learning Training Experiences in Interactive Information Retrieval},
  author = {Limin Chen and Zhiwen Tang and Grace Hui Yang},
  journal= {arXiv preprint arXiv:2006.03185},
  year   = {2021}
}

备注

Accepted by SIGIR 2020