中文

自学习对话系统中缺陷动作的规模化安全修复

人工智能 2023-05-19 v1 计算与语言 机器学习

摘要

离策略强化学习一直是前沿对话AI的驱动力,带来了更自然的人机交互并提升了面向目标智能体的用户满意度。然而,在大规模商业场景中,此类系统所处理的广泛应用谱系上,往往难以在策略改进与体验连续性之间取得平衡。文献中通常采用离策略评估与基于聚合统计的护栏方法来解决该问题。本文提出一种方法,用于整理并利用源自历史回归事故报告的高精度样本,以在在线部署前验证、防护并改进策略。我们使用来自真实对话系统与实际回归事故的数据进行了大量实验。所提方法目前已部署于我们的生产系统中,以保护客户免受破损体验影响并支持长期策略改进。

关键词

引用

@article{arxiv.2305.10528,
  title  = {Scalable and Safe Remediation of Defective Actions in Self-Learning Conversational Systems},
  author = {Sarthak Ahuja and Mohammad Kachuee and Fateme Sheikholeslami and Weiqing Liu and Jaeyoung Do},
  journal= {arXiv preprint arXiv:2305.10528},
  year   = {2023}
}

备注

Accepted at ACL 2023 Industry Track