中文

用于识别相似问题的有效迁移学习:将用户问题与 COVID-19 常见问题解答相匹配

信息检索 2020-09-01 v1 计算与语言 机器学习

摘要

人们越来越多地在线搜索其医学问题的答案,但在线提出的医学问题数量远远超过了合格人员回答这些问题的能力。这使得许多问题未得到回答或回答不充分。其中许多问题并非个例,若能可靠地识别相似问题,将实现更高效、更有效的问题解答机制。COVID-19 更是加剧了这一问题。几乎每个政府机构和医疗组织都试图通过建立在线 FAQ 来满足用户的信息需求,但人们无法提出自己的问题并知晓其是否已在某页面上得到解答。尽管许多研究工作聚焦于通用问题相似度这一难题,但这些方法在需要专家知识来判断语义相似度(如医学领域)的领域中泛化性不佳。在本文中,我们展示了一种双重微调方法——先在医学问答对上预训练神经网络,再在医学问题-问题对上微调——作为确定医学问题相似度这一最终目标特别有用的中间任务。尽管其他预训练任务在该任务上的准确率低于 78.7%,我们的模型在相同训练样本数下达到 82.6% 的准确率,在远小训练集下达到 80.0% 的准确率,并在使用全部医学问答数据语料时达到 84.5% 的准确率。我们还描述了一个当前已上线的系统,该系统使用训练好的模型将用户问题与 COVID 相关 FAQ 进行匹配。

关键词

引用

@article{arxiv.2008.13546,
  title  = {Effective Transfer Learning for Identifying Similar Questions: Matching User Questions to COVID-19 FAQs},
  author = {Clara H. McCreery and Namit Katariya and Anitha Kannan and Manish Chablani and Xavier Amatriain},
  journal= {arXiv preprint arXiv:2008.13546},
  year   = {2020}
}

备注

arXiv admin note: substantial text overlap with arXiv:1910.04192