Agentic AI 与人在环干预:来自阿里巴巴客服运营的实地实验证据
人机交互
2026-05-15 v1
摘要
自主执行服务任务的 Agentic AI 系统正进入客服运营领域。然而,当 Agentic AI 失败同时引发认知与情绪后果时,人工干预如何影响服务结果,目前仍缺乏实证证据。我们通过在阿里巴巴淘宝平台上的一项随机实地实验研究了这一问题。处理组工人监督一个 Agentic AI 系统处理符合 AI 条件的对话,同时继续处理不符合 AI 条件的对话,而对照组工人则在无 Agentic AI 辅助下处理所有对话。研究结果表明,AI 部署缩短了平均对话时长,对重试率的影响有限,但显著降低了对符合 AI 条件对话的评分。此外,在符合 AI 条件的对话中,人工干预的有效性取决于 AI 失败的性质、升级后干预的努力程度以及干预时机。人工干预在算法触发的技术升级(即超出 AI 能力的未解决客户问题)中能维持服务质量,但在算法触发的情绪升级(即客户表达沮丧或不满的情况)中效果较差。这些差异部分是由于工人在不同升级类型中升级后干预努力程度的差异所致。在算法触发的情绪升级中,工人的参与度较低:他们发送的信息更少,在总对话轮次中的贡献比例更小,并且在信息寻求和提供解决方案方面表现出较低的主动性。我们进一步发现,对不符合 AI 条件的对话存在正向溢出效应,因为处理组工人调整了其多任务工作流,将更多注意力投入到这些对话中。这些发现为人机协作系统中的人在环流程设计提供了启示。
关键词
引用
@article{arxiv.2605.14830,
title = {Agentic AI and Human-in-the-Loop Interventions: Field Experimental Evidence from Alibaba's Customer Service Operations},
author = {Yiwei Wang and Chuan Zhu and Tianjun Feng and Lauren Xiaoyuan Lu and Bingxin Jia},
journal= {arXiv preprint arXiv:2605.14830},
year = {2026}
}