Priberam 参与 MESINESP 医学文本多标签分类任务
计算与语言
2021-05-13 v1 机器学习
摘要
医学文章为许多医疗从业者和专业人员提供了最先进的治疗和诊断。现有公共数据库如 MEDLINE 包含超过 2700 万篇文章,若无高效搜索引擎则难以提取相关内容。信息检索工具对于导航并为文章和治疗提供有意义推荐至关重要。将这些文章分类到更广泛的医学主题可改善相关文章的检索。MESINESP 任务所考虑的医学标签集规模达数千个标签(DeCS 代码),属于极端多标签分类问题。医学主题的异质且高度分层结构使得人工分类文章极为繁琐且昂贵。因此,自动化分类过程至关重要。典型机器学习算法在如此大量标签下变得计算繁重,且在此类数据集上实现更好召回率成为未解决问题。本工作介绍 Priberam 参与 BioASQ 任务 Mesinesp。我们通过使用四种不同模型解决大型多标签分类问题:支持向量机(SVM)、定制搜索引擎(Priberam Search)、基于 BERT 的分类器,以及前述所有模型的 SVM-rank 集成。结果表明所有三个独立模型表现良好,且其集成取得最佳性能,使 Priberam 在本挑战中获第 6 名,并成为第 2 佳团队。
引用
@article{arxiv.2105.05614,
title = {Priberam at MESINESP Multi-label Classification of Medical Texts Task},
author = {Ruben Cardoso and Zita Marinho and Afonso Mendes and Sebastião Miranda},
journal= {arXiv preprint arXiv:2105.05614},
year = {2021}
}
备注
Presented at CLEF2020 conference (2020)