中文

弥合孟加拉语医疗保健差距:基于症状-疾病数据集的机器学习疾病预测

计算与语言 2026-01-21 v1 人工智能

摘要

对于非英语人群来说,增加获取可靠健康信息的途径至关重要,然而用于疾病预测的孟加拉语资源仍然有限。本研究通过构建一个全面的孟加拉语症状-疾病数据集来弥补这一差距,该数据集包含 758 个独特的症状-疾病关系,涵盖 85 种疾病。为确保透明度和可复现性,我们还将数据集公开。该数据集能够根据孟加拉语症状输入预测疾病,支持孟加拉语人群的医疗保健可及性。利用该数据集,我们评估了多种机器学习模型,以根据提供的孟加拉语症状预测疾病,并分析了它们在我们数据集上的性能。结合表现最佳模型的软投票和硬投票集成方法均达到了 98% 的准确率,展示了卓越的鲁棒性和泛化能力。我们的工作为孟加拉语的疾病预测建立了基础资源,为本地化健康信息学和诊断工具的未来发展铺平了道路。这一贡献旨在增强孟加拉语社区公平获取健康信息的机会,特别是对于早期疾病检测和医疗保健干预。

关键词

引用

@article{arxiv.2601.12068,
  title  = {Bridging the Gap in Bangla Healthcare: Machine Learning Based Disease Prediction Using a Symptoms-Disease Dataset},
  author = {Rowzatul Zannat and Abdullah Al Shafi and Abdul Muntakim},
  journal= {arXiv preprint arXiv:2601.12068},
  year   = {2026}
}