中文

用于对话式搜索的无奖励策略模仿学习

信息检索 2023-04-18 v1

摘要

现有的对话式搜索研究主要聚焦于提出更好的澄清性问题以及/或提升搜索结果质量。这些工作旨在根据搜索上下文检索更好的回复,其性能在单轮任务或朴素对话策略设置下的多轮任务上进行评估。这留下了关于它们在真实世界多轮对话中适用性的疑问,在真实场景中,实际上每个动作都需由系统自身做出,且搜索会话效率常是对话式搜索系统的重要关注点。尽管近期一些工作已认识到提升对话式搜索效率的必要性,它们大多需要大量数据标注并使用手工设计的奖励或启发式方法来训练能在受限轮数内取得合理性能的系统,这在实践中泛化能力有限。在本文中,我们提出一种无奖励对话策略模仿学习框架,其可在无标注对话数据或人工设计奖励的情况下训练对话策略。训练得到的对话策略可用于引导对话式检索模型以平衡对话式搜索的质量与效率。为评估所提出的对话式搜索系统,我们提出一种名为期望对话互逆排名(ECRR)的新的多轮多回复对话评估指标。ECRR 旨在评估整个多轮对话式搜索会话,以综合评估搜索结果质量与搜索效率。

关键词

引用

@article{arxiv.2304.07988,
  title  = {Reward-free Policy Imitation Learning for Conversational Search},
  author = {Zhenduo Wang and Zhichao Xu and Qingyao Ai},
  journal= {arXiv preprint arXiv:2304.07988},
  year   = {2023}
}