通过强化学习控制对话式搜索的风险
信息检索
2021-01-19 v1
摘要
用户经常使用不成熟的语言来表述其搜索查询,缺乏完善的关键词和完整的结构。此类查询无法表达其真实的信息需求,并且由于碎片化语言常产生多种解释和方面而引发歧义。这使搜索引擎难以处理和理解查询,最终导致检索结果不尽如人意。在面对歧义查询时,一种替代直接回答的方法是主动向用户提出澄清性问题。近年来,NLP 和 IR 领域出现了许多关于识别澄清性提问需求及其生成方法的工作和共享任务。这些工作常忽视的一个事实是:尽管有时能正确识别澄清性提问的需求,但这些系统生成的澄清性问题仍然偏离主题并引发用户不满,可能只是导致用户离开对话。在这项工作中,我们提出了一种风险感知的对话式搜索智能体模型,以平衡回答用户查询与提出澄清性问题的风险。该智能体充分意识到提出澄清性问题有可能从用户处收集更多信息,但它会比较所有可选方案并评估风险,之后才在回答与提问之间做出决策。为证明我们的系统能够检索到更好的答案,我们在 MSDialog 数据集上进行了实验,该数据集包含来自微软产品社区的真实客服对话。我们还提出了一种强化学习策略,使我们能够直接在原始数据集上训练模型,省去任何进一步的数据标注工作。实验结果表明,我们的风险感知对话式搜索智能体能够显著优于强大的非风险感知基线。
引用
@article{arxiv.2101.06327,
title = {Controlling the Risk of Conversational Search via Reinforcement Learning},
author = {Zhenduo Wang and Qingyao Ai},
journal= {arXiv preprint arXiv:2101.06327},
year = {2021}
}
备注
This paper is accepted by The Web Conference (WWW) 2021