中文

一种增强医疗保健社区问答的半监督学习方法:以酗酒为例的案例研究

机器学习 2016-07-05 v1

摘要

基于社区的问答 (CQA) 网站在满足健康信息需求方面发挥着重要作用。然而,大量发布的问题仍未得到回答。自动回答发布的问题可以为在线健康社区提供有用的信息来源。在本研究中,我们开发了一种算法,基于历史问答 (QA) 对自动回答健康相关问题。我们还旨在理解嵌入在在线健康内容中的信息,这些信息是识别有效答案的良好特征。我们提出的算法使用信息检索技术从已解决的 QA 中识别候选答案。为了对这些候选答案进行排序,我们实现了一种半监督学习算法,提取问题的最佳答案。我们在来自 Yahoo! Answers 的精选语料库上评估了此方法,并与基于规则的字符串相似度基线进行了比较。在我们的数据集上,半监督学习算法的准确率为 86.2%。模型中使用的基于 UMLS 的(健康相关)特征将算法性能提升了约 8%。考虑到数据相当嘈杂,这一准确率是相当高的。区分有效答案与无效答案的重要特征包括文本长度、测试问题中包含的停用词数量、测试问题与语料库中其他问题之间的距离,以及问题之间重叠的健康相关术语数量。总体而言,根据本案例研究中的数据集,我们基于历史 QA 对的自动问答系统被证明是有效的。它是为医疗保健领域的通用用途而开发的,也可以应用于其他 CQA 网站。

关键词

引用

@article{arxiv.1607.00706,
  title  = {A Semi-supervised learning approach to enhance health care Community-based Question Answering: A case study in alcoholism},
  author = {Papis Wongchaisuwat and Diego Klabjan and Siddhartha R. Jonnalagadda},
  journal= {arXiv preprint arXiv:1607.00706},
  year   = {2016}
}

备注

28 pages, 6 figures, 4 tables