面向任务型对话系统中模块联合优化的通用后处理网络
计算与语言
2025-02-04 v1 人工智能
摘要
后处理网络(PPN)是用于修改任务型对话系统中任意模块输出的组件,并通过强化学习(RL)进行优化,以提升系统的整体任务完成能力。然而,以往基于PPN的方法仅限于处理系统内的部分模块,这对提升系统性能构成了显著限制。在本研究中,我们提出了一种使用通用后处理网络(UniPPN)对所有模块输出进行后处理的联合优化方法。UniPPN是基于语言模型的网络,能够将系统中任意模块的输出修改视为一个序列转换任务。此外,我们的RL算法采用了模块级马尔可夫决策过程,能够为每个模块进行细粒度的价值和优势估计,从而稳定所有模块输出后处理的联合学习。通过使用MultiWOZ数据集进行的仿真实验和人工评估实验,我们证明UniPPN在任务型对话系统的任务完成能力上优于传统的PPN。
引用
@article{arxiv.2502.00747,
title = {Universal Post-Processing Networks for Joint Optimization of Modules in Task-Oriented Dialogue Systems},
author = {Atsumoto Ohashi and Ryuichiro Higashinaka},
journal= {arXiv preprint arXiv:2502.00747},
year = {2025}
}
备注
Accepted by AAAI 2025 Main Technical Track