真实、可信、又有难度:医学 AI 的边缘场景
计算与语言
2025-10-10 v2 人工智能
摘要
大型语言模型(LLM)在推动数字健康领域发展中发挥着重要作用,尤其在自动化医学问答方面展现出巨大潜力。然而,确保这些模型满足关键行业标准在事实准确性、实用性和安全性方面仍是一个挑战,尤其是对于开源解决方案而言。我们提出了严格的基准测试框架,构建了包含 1000 多条健康问题的数据集。我们评估了模型在诚实性、有用性和无害性方面的表现。我们的结果揭示了所评估模型之间在事实可靠性与安全性之间的权衡——包括 Mistral-7B、BioMistral-7B-DARE 和 AlpaCare-13B。AlpaCare-13B 在准确率(91.7%)和无害性(0.92)方面均取得最佳表现,而 BioMistral-7B-DARE 通过针对性微调在安全性(0.90)方面提升,尽管规模较小。少量样本提示将准确率从 78% 提升至 85%,而所有模型在复杂查询上均显示出帮助fulness 降低,这凸显了临床问答领域的持续挑战。
引用
@article{arxiv.2507.02983,
title = {Truth, Trust, and Trouble: Medical AI on the Edge},
author = {Mohammad Anas Azeez and Rafiq Ali and Ebad Shabbir and Zohaib Hasan Siddiqui and Gautam Siddharth Kashyap and Jiechao Gao and Usman Naseem},
journal= {arXiv preprint arXiv:2507.02983},
year = {2025}
}
备注
Accepted at EMNLP 2025 (Industry Track)