中文

通过受约束优化实现疲劳感知的学习式推迟

机器学习 2026-04-07 v2

摘要

学习式推迟 (L2D) 使人类-人工智能合作成为可能,通过决定 AI 系统应在自主行动还是推迟至人类专家之间做出选择。然而,现有的 L2D 方法假设人类性能为静态,这与关于疲劳导致性能下降的广泛认识相矛盾。我们提出疲劳感知学习式推迟通过受约束优化 (FALCON),其显式建模工作量可变的人类性能,使用基于心理学的疲劳曲线。FALCON 将 L2D 表述为受约束马尔可夫决策过程 (CMDP),其状态包括任务特征和累计人类工作量,通过 PPO-Lagrangian 训练在人类-人工智能合作预算下优化准确性。我们进一步引入了 FA-L2D,一个基准,系统性地变异疲劳动力学,从接近静态到快速退化的 regime。实验在多个数据集上表明,FALCON 在各种覆盖率水平下均一致优于最先进的 L2D 方法,零样本泛化到具有不同疲劳模式的未见专家,并且在覆盖率严格处于 0 和 1 之间时,演示了在人类-人工智能协作与 AI-only 或 human-only 决策之间优势。

关键词

引用

@article{arxiv.2604.00904,
  title  = {Fatigue-Aware Learning to Defer via Constrained Optimisation},
  author = {Zheng Zhang and Cuong C. Nguyen and David Rosewarne and Kevin Wells and Gustavo Carneiro},
  journal= {arXiv preprint arXiv:2604.00904},
  year   = {2026}
}