“三思而后言”:通过规划单动作对话改进多动作对话策略
计算与语言
2022-04-26 v1 人工智能
摘要
多动作对话策略(MADP)每轮生成多个原子对话动作,已广泛应用于任务型对话系统以提供富有表现力且高效的系统响应。现有 MADP 模型通常从标注的多动作对话样本中模仿动作组合。受数据限制,它们对未见对话流的泛化能力较差。虽然交互式学习与强化学习算法可应用于引入真实用户与用户模拟器的外部数据源,但其构建需大量人工且存在不稳定问题。为解决这些问题,我们提出规划增强对话策略(PEDP),一种通过学习单动作对话动态以增强多动作预测的新型多任务学习框架。我们的 PEDP 方法采用基于模型的规划,通过模拟单动作对话,在决定当前响应前构思要表达的内容。在 MultiWOZ 数据集上的实验结果表明,我们全监督的基于学习的方法取得了 90.6% 的稳健任务成功率,较最先进方法提升 3%。
引用
@article{arxiv.2204.11481,
title = {"Think Before You Speak": Improving Multi-Action Dialog Policy by Planning Single-Action Dialogs},
author = {Shuo Zhang and Junzhou Zhao and Pinghui Wang and Yu Li and Yi Huang and Junlan Feng},
journal= {arXiv preprint arXiv:2204.11481},
year = {2022}
}
备注
IJCAI 2022 long oral presentation