中文

用于动态匹配的势能学习及其在心脏移植中的应用

机器学习 2026-03-09 v2

摘要

每年,数千名需要心脏移植的患者因器官短缺面临致命等待时间。虽然分配政策旨在最大化人口水平结果,但当前方法往往未能考虑器官动态到达以及候审者构成,从而削弱了效率。美国正从僵化的基于规则的分配过渡到更灵活的数据驱动模型。在本文中,我们提出了一个用于一般在线匹配的非回望政策优化框架,利用势能概念,该概念最初用于肾脏交换。我们开发了可扩展且准确的势能学习方法,其维度更高、表达能力更强于先前方法。我们的做法是一种自监督式模仿学习:势能被训练以模仿一个拥有完美预知的算法。我们聚焦于心脏移植分配的应用,并使用真实历史数据显示,我们的政策在针对人口水平结果进行优化时显著优于先前方法——包括美国当前的现状政策和提出的连续分布框架。我们的分析和方法正值美国政策转折时刻,当前的心脏移植分配系统正在接受审查。我们提出了一条可扩展且在理论上有据可循的通向更有效器官分配的道路。

关键词

引用

@article{arxiv.2602.08877,
  title  = {Stress-Testing Alignment Audits With Prompt-Level Strategic Deception},
  author = {Oliver Daniels and Perusha Moodley and Benjamin M. Marlin and David Lindner},
  journal= {arXiv preprint arXiv:2602.08877},
  year   = {2026}
}

备注

Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI