从知识到推理:在 GlobalHealthAtlas 上的专业公共卫生推理形式化
计算与语言
2026-05-27 v3
摘要
公共卫生推理需要以科学证据、专家共识和安全约束为依托的群体水平推理。然而,这仍作为结构化机器学习问题受到忽视,由于受限的监督信号和基准数据集。我们引入 GlobalHealthAtlas,一个规模为 280,210 实例、覆盖 15 个公共卫生领域和 17 种语言的大规模多语言数据集。我们进一步提出了由大语言模型 (LLM) 辅助的构建和质量控制管道,包括检索、去重、证据 grounding 检查和标签验证,以提高规模化的一致性。最后,我们呈现了一个从多样化 LLM 的高置信判断中提炼的领域对齐评估器,用于沿六个维度评估输出:准确性、推理、完整性、共识对齐、术语规范和洞察性。正是这些贡献使得超越传统 QA 基准的 LLM 公共卫生推理训练和评估成为可复制的。我们公开了项目代码、评估器和模型: https://github.com/Jan8217/GlobalHealthAtlas, https://huggingface.co/aerovane0/GlobalHealthAtlas_Public_Evaluator 和 https://huggingface.co/aerovane0/GlobalHealthAtlas_Public_Model。
引用
@article{arxiv.2602.00491,
title = {From Knowledge to Inference: Formalizing Specialized Public Health Reasoning on GlobalHealthAtlas},
author = {Zhaokun Yan and Shan Xu and Wuzheng Dong and Zhaohan Liu and Lijie Feng and Chengxiao Dai and Chen Tianqi and Binfan Liu and Yunpu Ma and Wenting Wei and Yingting Li and Yi Zhang and Tongning Wu},
journal= {arXiv preprint arXiv:2602.00491},
year = {2026}
}