与真实用户进行语义解析器与对话管理器在线联合强化学习实验的发现
计算与语言
2021-10-27 v1 人机交互
摘要
对话系统的设计近来取得了诸多进展,然而获取大量数据仍是其在新任务或新语言上快速发展的障碍。此外,使用批处理数据训练交互式系统并不令人满意。本文追求在线学习,将其作为一种缓解这些困难的便捷途径。在系统模块初始化后,单一流程负责数据收集、标注以及在训练算法中的使用。一个新的挑战是控制用户承担的在线学习成本。我们的工作聚焦于学习语义解析与对话管理模块(语音识别与合成已有即用方案)。在此背景下,我们研究了几种同时学习的变体,并在用户试验中进行了测试。在我们的实验中,这些变体各有优劣,但均能仅通过数百次训练对话达到良好性能,并超越手工构建的系统。对这些实验的分析为我们提供了一些见解(本文中进行了讨论),即系统训练者难以建立连贯且稳定的行为策略,以实现快速且高质量的训练阶段。
引用
@article{arxiv.2110.13213,
title = {Findings from Experiments of On-line Joint Reinforcement Learning of Semantic Parser and Dialogue Manager with real Users},
author = {Matthieu Riou and Bassam Jabaian and Stéphane Huet and Fabrice Lefèvre},
journal= {arXiv preprint arXiv:2110.13213},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:1810.00924