解码MIE:一种结合主题提取与隶属关系解析的新型数据集方法
信息检索
2024-10-08 v1
摘要
医学信息学文献的快速扩展给综合和分析研究趋势带来了巨大挑战。本研究引入了一个源自医学信息学欧洲(MIE)会议论文集的新型数据集,以满足该领域对复杂分析工具的需求。利用Triple-A软件,我们从“健康技术与信息学研究”期刊系列中提取并处理了自1996年以来MIE会议发表的4606篇文章的元数据和摘要。我们的方法采用了先进技术,例如使用TextRank算法进行隶属关系解析。最终的数据集以JSON格式提供,提供了文献计量细节、提取的主题和标准化隶属关系信息的全面视图。对该数据的分析揭示了数字对象标识符使用、引用趋势和作者归属在多年间的有趣模式。值得注意的是,我们观察到作者数据的不一致性以及出版物中一段短暂的语种多样性时期。该数据集是对医学信息学社区的重要贡献,能够实现对研究趋势的纵向研究、合作网络分析和深入的文献计量调查。通过提供这个跨越近三十年会议论文集的丰富结构化资源,我们旨在促进对快速发展的医学信息学领域的新见解和进步。
引用
@article{arxiv.2410.04602,
title = {Decoding MIE: A Novel Dataset Approach Using Topic Extraction and Affiliation Parsing},
author = {Ehsan Bitaraf and Maryam Jafarpour},
journal= {arXiv preprint arXiv:2410.04602},
year = {2024}
}