从 PhysioNet 到基础模型——历史与潜在未来
摘要
过去 35 年,医学数据和模型的共享从 sneakernet 演变为互联网——从邮寄磁带和光盘上的少量精选录音,到高速下载相对完整的医院数据库。更近期地,围绕现代机器学习和'AI'能否引领我们进入下一个工业革命的热潮,导致对将几乎任何数据源输入大型模型的欲望日益饥渴。尽管这具有巨大潜力,但也带来了一系列新挑战。本文检视了过去 30 年的这些趋势,借鉴了心脏病学的实例,该领域是经典数据密集型领域,正通过机器学习迎来复兴。从计算机化心脏病学的早期日子起,Research Resource for Complex Physiologic Signals(PhysioNet)就一直处于该领域的前沿。因此,本文包括该资源的历史以及来自与其创始人共同开发该资源元素的 25 年实战经验。我确定最具前景的未来方向,以及更广泛地围绕大规模生理学数据库、关联开放代码和公共竞赛的日益增长的问题与机遇,以及应对我们领域关键问题的潜在解决方案。主题涵盖如何在快速增长的 AI 碳足迹背景下处理基础模型、Tiny-ML 和边缘计算的潜力,以及奖品与激励、资金模式和科学可重复性的问题,以及如何通过与 PhysioNet 竞赛保持一致来解决这些问题——这符合该资源早期开放获取理念。
引用
@article{arxiv.2602.15371,
title = {From PhysioNet to Foundation Models -- A History and Potential Futures},
author = {Gari D. Clifford},
journal= {arXiv preprint arXiv:2602.15371},
year = {2026}
}
备注
56 pages, 6 figures, 3 tables. Extended from: Gari D. Clifford. Past, Present and Future Challenges in Sharing Science: From PhysioNet to Foundation Models. 51st Computing in Cardiology, Karlsruhe, Germany, 51:1-4, 2024