知识增强的中文医疗机器阅读理解表示学习:任务、模型与资源
计算与语言
2021-08-23 v2 人工智能
机器学习
摘要
机器阅读理解(MRC)旨在给定段落提取问题的答案。近年来其被广泛研究,尤其在开放领域。然而,封闭领域MRC少有进展,主要由于缺少大规模训练数据。本文引入一个医疗领域的多目标MRC任务,其目标是同时从医疗信息源中预测医疗问题答案及对应支撑句,以保障医疗知识服务的高可靠性。为此人工构建了一个高质量数据集,命名为多任务中文医疗MRC数据集(CMedMRC),并进行了详细分析。我们进一步提出面向该任务的中文医疗BERT模型(CMedBERT),通过异质特征动态融合机制与多任务学习策略将医疗知识融入预训练语言模型。实验表明,CMedBERT通过融合上下文感知与知识感知的词元表示,持续优于强基线。
引用
@article{arxiv.2008.10327,
title = {Knowledge-Empowered Representation Learning for Chinese Medical Reading Comprehension: Task, Model and Resources},
author = {Taolin Zhang and Chengyu Wang and Minghui Qiu and Bite Yang and Xiaofeng He and Jun Huang},
journal= {arXiv preprint arXiv:2008.10327},
year = {2021}
}
备注
ACL2021 (findings)