用于提高诊断准确性的疾病-症状关联结构化数据集
计算与语言
2025-09-09 v5
摘要
疾病-症状数据集对于医学研究、疾病诊断、临床决策和 AI 驱动的健康管理应用具有重要意义。这些数据集有助于识别与特定疾病相关的症状模式,从而提高诊断准确性并实现早期检测。本研究呈现的数据集系统地整理了来自各种在线来源、医学文献和公开可用健康数据库的疾病-症状关系。数据通过分析同行评审的医学文章、临床病例研究和疾病-症状关联报告收集。仅包含经过验证的医学来源,排除了非同行评审和轶事来源的数据集。数据集以表格格式组织,第一列代表疾病,其余列代表症状。每个症状单元格包含一个二进制值,指示该症状是否与疾病相关联。因此,这种结构化表示使数据集非常适用于广泛的应用,包括基于机器学习的疾病预测、临床决策支持系统和流行病学研究。尽管在疾病-症状数据集领域已有一些进展,但在孟加拉语(Bangla)语言的结构化数据集方面仍存在显著空白。本数据集旨在通过促进多语言医学信息学工具的开发和改进代表性不足语言社区的疾病预测模型来填补这一空白。进一步的发展应包括区域特异性疾病和进一步微调症状关联以获得更好的诊断性能。
引用
@article{arxiv.2506.13610,
title = {A Structured Dataset of Disease-Symptom Associations to Improve Diagnostic Accuracy},
author = {Abdullah Al Shafi and Rowzatul Zannat and Abdul Muntakim and Mahmudul Hasan},
journal= {arXiv preprint arXiv:2506.13610},
year = {2025}
}
备注
Computational Biology