利用强化学习进行开放域多跳搜索的学习
计算与语言
2022-05-31 v1 人工智能
摘要
我们提出一种方法,教导自动化智能体学习如何在开放域中搜索实体间关系的多跳路径。该方法学习一种策略,用于引导现有的信息检索与机器阅读资源聚焦于语料库的相关区域。该方法将学习问题表述为马尔可夫决策过程,其状态表示编码搜索过程的动态,奖励结构在仍能找到多跳路径的同时最小化必须处理的文档数量。我们在演员-评论家(actor-critic)强化学习算法中实现该方法,并在源自英语维基百科子集的搜索问题数据集上评估。该算法找到了一系列策略,相较于若干基线启发式算法,能在处理更少文档的同时成功抽取所需信息。
引用
@article{arxiv.2205.15281,
title = {Learning Open Domain Multi-hop Search Using Reinforcement Learning},
author = {Enrique Noriega-Atala and Mihai Surdeanu and Clayton T. Morrison},
journal= {arXiv preprint arXiv:2205.15281},
year = {2022}
}
备注
Accepted for publication at the Structured and Unstructured Knowledge Integration (SUKI) workshop, held at NAACL-HLT 2022