带延迟反馈的双层情境型臂问题用于个性化资源分配
人工智能
2025-11-17 v2 机器学习
摘要
在高风险领域如教育、就业和医疗等领域,公平分配有限资源需要在短期效用与长期影响之间进行平衡,同时考虑延迟结果、隐藏异质性和伦理约束。然而,大多数基于学习的分配框架要么假设即时反馈,要么忽略个体特征与干预动态之间的复杂相互作用。我们提出了一个新的双层情境型臂框架,用于在延迟反馈下的个性化资源分配,旨在适应具有动态人口、容量约束和时敏影响的真实世界环境。在元水平,模型优化子组级预算分配以满足公平性和运营约束。在基层,模型使用在观察数据上训练的神经网络识别每个组中最响应的个体,同时尊重冷却窗口和通过资源特定延迟核建模的延迟处理效果。通过显式建模时间动态和反馈延迟,算法不断细化其策略,以便在新数据到来时实现更具响应性和适应性的决策。我们在来自教育和职业发展的两个真实世界数据集上对我们的方案进行了验证,表明它实现了更高的累积效应,更好地适应了延迟结构,确保了子组间的公平分配。我们的结果凸显了延迟感知、数据驱动决策系统在改进制度政策和社会福利方面的潜力。
引用
@article{arxiv.2511.10572,
title = {Bi-Level Contextual Bandits for Individualized Resource Allocation under Delayed Feedback},
author = {Mohammadsina Almasi and Hadis Anahideh},
journal= {arXiv preprint arXiv:2511.10572},
year = {2025}
}
备注
Accepted at AAAI-26 (AISI Track). Final version to appear in the Proceedings of the AAAI Conference on Artificial Intelligence (AAAI-26), 2026