中文

拥塞系统中的延迟学习:AI 与人类的交互

机器学习 2025-08-14 v4 人工智能 计算机科学与博弈论 人机交互 性能

摘要

高风险应用依赖于结合人工智能(AI)与人类以实现响应迅速且可靠的决策。例如,社交媒体平台的内容审核通常采用 AI-人类流水线,以及时移除违规内容而不损害合法内容。一种典型的启发式方法会估计传入内容的风险,并使用固定阈值来决定是否自动删除内容(分类)以及是否将其发送给人工审核(准入)。这种方法可能效率低下,因为它忽视了 AI 估计中的不确定性、内容到达和人工审核容量的时变特性,以及在线数据集中的选择性采样(人类仅审核经 AI 过滤的内容)。在本文中,我们引入了一种模型来捕捉这种 AI-人类交互。在该模型中,AI 观察传入任务的上下文信息,做出分类和准入决策,并调度被准入的任务进行人工审核。在这些审核过程中,人类观察任务的真实成本,并可能推翻错误的 AI 分类决策。这些审核也作为新数据用于训练 AI,但由于人工审核系统的拥塞而存在延迟。目标是最小化最终被错误分类任务的成本。我们提出了一种近优学习算法,该算法仔细平衡了来自选择性采样数据集的分类损失、未审核任务的特异性损失以及人工审核系统拥塞导致的延迟损失。据我们所知,这是关于上下文排队系统中在线学习的首个结果。此外,基于在线评论数据集的数值实验表明,与现有的内容审核实践相比,我们的算法可以显著减少错误分类的数量。

关键词

引用

@article{arxiv.2402.12237,
  title  = {Learning to Defer in Congested Systems: The AI-Human Interplay},
  author = {Thodoris Lykouris and Wentao Weng},
  journal= {arXiv preprint arXiv:2402.12237},
  year   = {2025}
}