中文

医疗领域语言模型应用的性能评估策略

机器学习 2026-03-09 v2 人工智能

摘要

语言模型是人工智能领域的新兴范式,在整个医疗领域有广泛应用。全面理解临床任务并意识到在实际临床环境中实施时的性能差异,为语言模型应用评估奠定了基础。目前,评估这些生成模型性能的主流方法依赖于定量基准。这类基准存在局限性,可能遭受训练集到测试集的过拟合,即以牺牲跨其他任务和数据分布的泛化能力为代价来优化特定测试集的性能。利用人类专业知识并利用成本效益高的计算模型作为评估器的评估策略正受到越来越多的关注。我们讨论了评估语言模型在医疗保健和医疗器械中应用性能的当前最先进方法。

关键词

引用

@article{arxiv.2509.08087,
  title  = {Performance Assessment Strategies for Language Model Applications in Healthcare},
  author = {Victor Garcia and Mariia Sidulova and Aldo Badano},
  journal= {arXiv preprint arXiv:2509.08087},
  year   = {2026}
}