一种用于带句子级反馈的交互式搜索的深度强化学习方法
机器学习
2023-10-06 v1 人工智能
人机交互
信息检索
摘要
交互式搜索可通过纳入用户的交互反馈来提供更好的体验。这能显著提升搜索准确性,因为它有助于规避无关信息并捕捉用户的搜索意图。现有的最先进(SOTA)系统使用强化学习(RL)模型来纳入交互,但聚焦于条目级反馈,忽略了句子级反馈中的细粒度信息。然而此类反馈需要广泛的 RL 动作空间探索与大量标注数据。本工作通过提出一种新的深度 Q 学习(DQ)方法 DQrank 来应对这些挑战。DQrank 适配基于 BERT 的模型(自然语言处理中的 SOTA)以根据用户参与程度筛选关键句子并对条目排序,从而获得更令人满意的响应。我们还提出两种机制以更好地探索最优动作。DQrank 进一步利用 DQ 中的经验回放机制来存储反馈句子,以获得更好的初始排序性能。我们在三个搜索数据集上验证了 DQrank 的有效性。结果显示 DQrank 比先前的 SOTA RL 方法至少高出 12%。我们还进行了详细的消融研究。消融结果表明每个模型组件均能高效地从用户的句子级反馈中提取并累积长期参与效应。该结构为构建带句子级交互的搜索系统提供了具有可期性能的新技术。
引用
@article{arxiv.2310.03043,
title = {A Deep Reinforcement Learning Approach for Interactive Search with Sentence-level Feedback},
author = {Jianghong Zhou and Joyce C. Ho and Chen Lin and Eugene Agichtein},
journal= {arXiv preprint arXiv:2310.03043},
year = {2023}
}
备注
9 pages, 7 figures, DRL4IR@CIKM