KenMeSH:知识增强的端到端生物医学文本标注
计算与语言
2022-03-15 v1
摘要
目前,医学主题词表(MeSH)被手动分配给每篇发表的生物医学文章,并随后记录于 PubMed 数据库中,以便于检索相关信息。随着 PubMed 数据库的快速增长,大规模生物医学文献索引变得愈发重要。MeSH 索引对机器学习而言是一项具有挑战性的任务,因为它需要从极大规模、按层次组织的集合中为每篇文章分配多个标签。为应对这一挑战,我们提出 KenMeSH,一种端到端模型,其结合了全新的文本特征与动态\textbf{K}nowledge-\textbf{en}hanced 掩码注意力(知识增强掩码注意力),将文档特征与 MeSH 标签层次结构及期刊相关性特征相整合,以索引 MeSH 术语。实验结果表明,所提方法在多项指标上取得了最先进的性能。
引用
@article{arxiv.2203.06835,
title = {KenMeSH: Knowledge-enhanced End-to-end Biomedical Text Labelling},
author = {Xindi Wang and Robert E. Mercer and Frank Rudzicz},
journal= {arXiv preprint arXiv:2203.06835},
year = {2022}
}
备注
main conference at ACL 2022