超越语义相似性:面向医学问答系统的分量级评估框架及其健康公平性影响
人机交互
2026-04-22 v1 人工智能
计算与语言
机器学习
摘要
使用大型语言模型(LLM)支持患者解决医学问题的应用日益增长。然而,目前用于评估这些模型在此情境下表现的大多数指标仅衡量模型答案与参考答案之间的语义相似性,无法真实反映模型的医学准确性或其所潜在的健康公平性风险。为此,我们提出一种新的医学问答评估框架 VB-Score(基于验证的得分),对医学问答模型的四个组成部分(实体识别、语义相似性、事实一致性和结构化信息完整性)进行独立评估。我们对三种广受欢迎且广泛使用的 LLM 在 48 个来自高质量权威信息来源的公共卫生主题上的表现进行严格评估。基于我们的分析,我们发现模型的语义准确性与实体准确性之间存在重大差异。我们对所有三种模型的表现进行评估显示,每个模型在我们的标准下几乎都表现出严重的性能失效。我们的发现表明,各种公共卫生主题之间存在令人警惕的性能差异,大多数模型在与总体平均水平相比,所有涉及老年人和少数族裔人群的慢性病公共卫生主题表现低出 13.8%,这表明存在所谓的基于症状的算法歧视。我们的发现还表明,仅凭提示工程无法弥补这些模型在提取医学实体方面的基本架构局限性,并引出是否存在语义评估alone足以衡量医学人工智能安全性的问题。
引用
@article{arxiv.2604.19281,
title = {Beyond Semantic Similarity: A Component-Wise Evaluation Framework for Medical Question Answering Systems with Health Equity Implications},
author = {Abu Noman Md Sakib and Md. Main Oddin Chisty and Zijie Zhang},
journal= {arXiv preprint arXiv:2604.19281},
year = {2026}
}
备注
Accepted in the Ninth Annual ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT) 2026